콘텐츠로 이동

모니터링 및 리소스

/admin/resources를 열면 호스트 활용도의 실시간 스냅샷을 볼 수 있습니다:

관리자 Resources 페이지: 호스트 전체 합계, 사용자별 분류 테이블, 활용도 및 메모리가 표시된 GPU 카드

  • 사용자별 분류: 실행 중인 워크스페이스가 하나 이상 있는 모든 사용자의 CPU 코어, 메모리, GPU 분율, 권고 디스크 알림 임계값 대비 사용량.
  • GPU 카드: 물리적 GPU별 현재 활용도 비율, 온도, 사용된 메모리.
  • 이미지 저장소: 사용자별 이미지 디스크 사용량.
  • 유휴 후보: 최근 CPU·GPU·터미널 활동이 없는 실행 중인 워크스페이스 (idle_window_seconds 임계값 기준).

페이지는 몇 초마다 서버를 폴링합니다. 새로 고침을 클릭하면 즉시 샘플을 강제로 가져옵니다.

nvidia-smi가 LabPod 워크스페이스에 속하지 않는 GPU 컴퓨팅 프로세스를 감지하면 Resources 페이지가 영향받은 GPU 아래에 경고를 표시합니다. 보통 다음 중 하나입니다:

  • 사용자가 컨테이너 밖 호스트에서 직접 훈련을 실행 중.
  • 워크스페이스가 삭제되었지만 자식 프로세스가 GPU 메모리를 보유 중.

조사하려면:

Terminal window
nvidia-smi --query-compute-apps=pid,process_name,used_memory,gpu_uuid --format=csv

해제하려면:

Terminal window
sudo kill -TERM <pid>
# 30초 후에도 실행 중이면:
sudo kill -KILL <pid>
Terminal window
# Run these as root
kill -TERM <pid>
# 30초 후에도 실행 중이면:
kill -KILL <pid>

인스펙터를 조정하거나 비활성화하는 방법은 GPU 구성을 참조하세요.

구성한 디스크 용량 파일시스템이 90% 사용을 초과하면 관리자 대시보드에 디스크 압박 배너가 표시됩니다. LABPOD_DISK_ROOT를 설정하지 않으면 항상 /home이 아니라 LABPOD_FILEOP_HOME_BASE가 있는 파일시스템을 측정합니다. 실행 중인 워크스페이스가 체크포인트 쓰기에 실패하기 전에 조치하세요.

디스크 위생 명령:

Terminal window
du -sh /var/lib/labpod/ # 데이터베이스 + 백업
du -sh /var/lib/labpod/backups/ # 백업 파일만
sudo podman system df # root의 이미지 저장소
sudo -u <user> podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)
Terminal window
# Run these as root
du -sh /var/lib/labpod/ # 데이터베이스 + 백업
du -sh /var/lib/labpod/backups/ # 백업 파일만
podman system df # root의 이미지 저장소
runuser -u <user> -- podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)

일반적인 배포에서 디스크를 가장 많이 차지하는 항목:

  • 각 사용자의 ~/.local/share/containers/storage/에 있는 컨테이너 이미지
  • ~/work/.hf-cache/에 있는 Hugging Face 모델 캐시 (LabPod가 HF_HOME을 여기로 설정함)
  • 공유 마운트 디렉토리의 데이터셋

관리자 사용량 페이지 (/admin/usage)는 사용자별 일별 요약을 보여주고 CSV로 내보낼 수 있습니다:

  • /api/usage/users/{serverUserID}: 특정 사용자의 일별 통계
  • /api/usage/users/{serverUserID}.csv: CSV 다운로드
  • /api/usage/all.csv: 모든 사용자의 CSV 하나로

보고 기간과 CSV의 day 값은 UTC를 사용합니다. 원시 사용량 샘플은 최소 25시간, 기본값으로 48시간 동안 보관하며 일별 롤업은 무기한 유지됩니다. 차트는 최근 12개월을 보여 주고 연도/월 선택기와 차트 막대를 누르면 해당 월의 일별 상세를 불러옵니다. 런타임 설정usage_sample_retention_hours로 원시 샘플 보관 기간을 조정하세요.

감사 (Audit) 페이지 (/admin/audit)는 모든 변경 사항의 시간순 로그를 표시합니다:

  • 사용자 생성 및 삭제
  • 워크스페이스 시작, 중지, 소유자가 실행한 삭제 및 관리자 강제 중지
  • 템플릿 및 정책 변경
  • 이미지 풀 및 빌드
  • 로그인 실패

로그인 실패를 auth.login_failed 저널 항목과 연결하세요:

Terminal window
sudo journalctl -u labpod --since "1 hour ago" | grep login_failed
Terminal window
# Run these as root
journalctl -u labpod --since "1 hour ago" | grep login_failed

감사 기록은 기본값으로 무기한 보관합니다. 설치의 보존 정책에서 허용할 때만 Admin → Runtime settings에서 양수 감사 로그 보관 기간을 설정해 오래된 감사 기록을 영구적으로 제거할 수 있습니다.