콘텐츠로 이동

모니터링 및 리소스

Monitoring(/admin/resources, 모든 superuser에게 표시)을 열면 호스트 활용도의 실시간 스냅샷을 볼 수 있습니다.

관리자 Resources 페이지: 호스트 전체 합계, 사용자별 분류 테이블, 활용도 및 메모리가 표시된 GPU 카드

  • 사용자별 분류: 실행 중인 워크스페이스가 하나 이상 있는 모든 사용자의 CPU 코어, 메모리, GPU 분율, 권고 디스크 알림 임계값 대비 사용량.
  • GPU 카드: 물리적 GPU별 현재 활용도 비율, 온도, 사용된 메모리.
  • 이미지 저장소: 사용자별 이미지 디스크 사용량.
  • 유휴 후보: 최근 CPU·GPU·터미널 활동이 없는 실행 중인 워크스페이스 (idle_window_seconds 임계값 기준).

페이지는 몇 초마다 서버를 폴링합니다. 새로 고침을 클릭하면 즉시 샘플을 강제로 가져옵니다.

nvidia-smi가 LabPod 워크스페이스에 속하지 않는 GPU 컴퓨팅 프로세스를 감지하면 Resources 페이지가 영향받은 GPU 아래에 경고를 표시합니다. 보통 다음 중 하나입니다:

  • 사용자가 컨테이너 밖 호스트에서 직접 훈련을 실행 중.
  • 워크스페이스가 삭제되었지만 자식 프로세스가 GPU 메모리를 보유 중.

조사하려면:

Terminal window
nvidia-smi --query-compute-apps=pid,process_name,used_memory,gpu_uuid --format=csv

해제하려면:

Terminal window
sudo kill -TERM <pid>
# 30초 후에도 실행 중이면:
sudo kill -KILL <pid>
Terminal window
# Run these as root
kill -TERM <pid>
# 30초 후에도 실행 중이면:
kill -KILL <pid>

인스펙터를 조정하거나 비활성화하는 방법은 GPU 구성을 참조하세요.

설정한 디스크 용량 파일시스템의 사용률이 **90%**를 넘으면 관리자 대시보드에 디스크 압박 배너가 나타납니다. LABPOD_DISK_ROOT의 기본값은 /home입니다. LabPod은 활성 사용자의 유효한 루트리스 Podman graphroot가 있는 별도 파일시스템도 모두 모니터링합니다. 이미지 풀, 쓰기 가능 레이어, 워크스페이스 데이터가 실패하기 전에 조치하세요.

디스크 위생 명령:

Terminal window
du -sh /var/lib/labpod/ # 데이터베이스 + 백업
du -sh /var/lib/labpod/backups/ # 백업 파일만
sudo -u <user> podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)
Terminal window
# Run these as root
du -sh /var/lib/labpod/ # 데이터베이스 + 백업
du -sh /var/lib/labpod/backups/ # 백업 파일만
runuser -u <user> -- podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)

LabPod에는 root 워크스페이스 이미지 저장소가 없습니다. 관리자의 Monitoring은 읽기 전용입니다. root와 다른 superuser는 사용자별 이미지 사용량과 작업 이력을 볼 수 있지만, 다른 사용자의 이미지를 삭제하거나 prune할 수 없습니다.

일반적인 배포에서 디스크를 가장 많이 차지하는 항목:

  • 각 사용자의 유효한 루트리스 Podman graphroot에 있는 컨테이너 이미지
  • <passwd-home>/work/.hf-cache/ 또는 별도 <LABPOD_WORK_BASE>/<user>/work/.hf-cache/에 있는 Hugging Face 모델 캐시 (LabPod은 HF_HOME=/work/.hf-cache로 설정합니다)
  • 공유 마운트 디렉토리의 데이터셋

모든 사용자의 루트리스 저장소를 다른 로컬 디스크에 두거나 기존 저장소를 안전하게 옮기는 방법은 루트리스 Podman 저장소를 참조하세요. LabPod은 유효 경로를 찾지만 Podman 설정을 수정하거나 레이어를 옮기지 않습니다.

관리자 Usage report 페이지 (/admin/usage, People 아래, 모든 superuser에게 표시)는 사용자별 일별 요약을 보여주고 CSV로 내보낼 수 있습니다.

  • /api/usage/users/{serverUserID}: 특정 사용자의 일별 통계
  • /api/usage/users/{serverUserID}.csv: CSV 다운로드
  • /api/usage/all.csv: 모든 사용자의 CSV 하나로

보고 기간과 CSV의 day 값은 UTC를 사용합니다. 원시 사용량 샘플은 최소 25시간, 기본값으로 48시간 동안 보관하며 일별 롤업은 무기한 유지됩니다. 차트는 최근 12개월을 보여 주고 연도/월 선택기와 차트 막대를 누르면 해당 월의 일별 상세를 불러옵니다. 런타임 설정의 usage_sample_retention_hours로 원시 샘플 보관 기간을 조정하세요.

Audit 페이지 (/admin/audit, 모든 superuser에게 표시)는 모든 변경 사항의 시간순 로그를 표시합니다.

  • 사용자 생성 및 삭제
  • 워크스페이스 시작, 중지, 소유자가 실행한 삭제 및 관리자 강제 중지
  • 워크스페이스 템플릿 및 정책 변경
  • 이미지 풀 및 빌드
  • 로그인 실패

로그인 실패를 auth.login_failed 저널 항목과 연결하세요:

Terminal window
sudo journalctl -u labpod --since "1 hour ago" | grep login_failed
Terminal window
# Run these as root
journalctl -u labpod --since "1 hour ago" | grep login_failed

감사 기록은 기본값으로 무기한 보관합니다. 설치의 보존 정책이 허용하는 경우에만 System → Advanced overrides에서 감사 로그 보관 기간을 양수로 설정해 오래된 감사 기록을 영구적으로 제거할 수 있습니다.