콘텐츠로 이동

워크스페이스가 중지될 때

워크스페이스는 사용자 또는 관리자가 중지하기 전까지 계속 실행됩니다. 하지만 워크스페이스가 자동으로 중지되거나 비정상 상태로 표시되는 경우가 몇 가지 있습니다.

커널이 메모리 압박으로 워크스페이스를 종료하면 카드와 상세 페이지에 OOM 알림이 표시됩니다. 이 알림만으로 선택한 워크스페이스 제한을 넘었다고 단정할 수는 없습니다. 호스트 전체의 메모리 부족도 같은 결과를 만들 수 있습니다.

OOM 종료

해결 방법:

  • 메모리 사용량 줄이기: 배치 크기 축소, DataLoader 워커 수 감소, 한 번에 로드하는 데이터 줄이기.
  • 또는 관리자에게 워크스페이스 제한과 호스트 전체 메모리 압박을 모두 확인해 달라고 요청한 뒤 시작을 다시 클릭하세요.

컨테이너의 주요 프로세스가 중지 작업 없이 스스로 종료되면 워크스페이스가 stopped 상태가 되며 다음이 표시됩니다:

예기치 않게 종료됨 (코드 N)

대개 템플릿의 주 프로세스가 충돌했거나 컨테이너 안에서 종료됐다는 뜻입니다. 워크스페이스 상세 페이지의 컨테이너 로그를 확인한 뒤 다시 시작하세요.

프로세스 수준 OOM (학습이 종료되었지만 워크스페이스는 실행 중)

섹션 제목: “프로세스 수준 OOM (학습이 종료되었지만 워크스페이스는 실행 중)”

컨테이너 안의 프로세스가 OOM으로 종료돼도 컨테이너 자체는 살아 있을 수 있습니다. 터미널에서 학습 스크립트가 Killed와 함께 끝나는데도 워크스페이스가 running 상태를 유지한다면, 커널이 컨테이너가 아니라 그 안의 Python 프로세스만 종료했기 때문입니다.

터미널에서 dmesg | tail로 확인하거나 런처 로그를 살펴보세요. 해결 방법은 같습니다. 메모리 사용량을 줄이세요.

워크스페이스는 서버가 재부팅될 때 자동으로 재시작되지 않습니다. 재부팅 후:

  • 실행 중이던 모든 워크스페이스가 stopped 상태로 표시되며 상태가 호스트 재시작으로 중지로 나타납니다.
  • 워크스페이스 카드의 배너에 재부팅으로 중지되었다는 안내가 뜹니다.
  • 메모리 내 상태가 사라집니다: 실행 중인 커널, 학습 프로세스, 터미널 스크롤백.
  • 시작을 클릭해 워크스페이스를 다시 시작하세요.

잃어서는 안 되는 데이터는 체크포인트를 /work에 저장하세요. /work는 호스트 디렉터리라 재부팅 후에도 유지됩니다 (데이터가 컨테이너가 아니라 디스크에 있기 때문입니다).

워크스페이스가 며칠 동안 비활성 상태이면 (기본값은 연속 5일이며, 관리자가 설정), 홈 페이지의 워크스페이스 카드에 유휴 알림 배지가 표시됩니다. 표시 전용이라 자동으로 중지되거나 삭제되지는 않습니다. 워크스페이스 사용이 끝났다면 GPU를 다른 사람이 쓸 수 있다는 것을 알려 주는 배지입니다.

관리자는 언제든지 워크스페이스를 강제 중지할 수 있습니다(삭제는 불가). 예를 들어 오랫동안 유휴 상태인 GPU를 회수할 때가 그렇습니다. 워크스페이스 삭제는 소유자만 할 수 있습니다. 워크스페이스가 예기치 않게 중지된다면 관리자에게 문의하세요.

위의 모든 경우에 복구 방법은 같습니다:

  1. 워크스페이스 카드 또는 상세 페이지에서 중지 이유를 확인하세요.
  2. 근본 원인을 해결하세요 (메모리 줄이기, 데이터 저장, 재부팅 완료 대기).
  3. 시작을 클릭하세요.

/work의 파일과 워크스페이스 홈은 그대로 유지됩니다. 메모리 내 상태만 손실됩니다.