모니터링 및 리소스
Resources 페이지
섹션 제목: “Resources 페이지”Monitoring(/admin/resources, 모든 superuser에게 표시)을 열면 호스트 활용도의 실시간
스냅샷을 볼 수 있습니다.

- 사용자별 분류: 실행 중인 워크스페이스가 하나 이상 있는 모든 사용자의 CPU 코어, 메모리, GPU 분율, 권고 디스크 알림 임계값 대비 사용량.
- GPU 카드: 물리적 GPU별 현재 활용도 비율, 온도, 사용된 메모리.
- 이미지 저장소: 사용자별 이미지 디스크 사용량.
- 유휴 후보: 최근 CPU·GPU·터미널 활동이 없는 실행 중인 워크스페이스 (
idle_window_seconds임계값 기준).
페이지는 몇 초마다 서버를 폴링합니다. 새로 고침을 클릭하면 즉시 샘플을 강제로 가져옵니다.
추적되지 않은 GPU 사용량
섹션 제목: “추적되지 않은 GPU 사용량”nvidia-smi가 LabPod 워크스페이스에 속하지 않는 GPU 컴퓨팅 프로세스를 감지하면 Resources 페이지가 영향받은 GPU 아래에 경고를 표시합니다. 보통 다음 중 하나입니다:
- 사용자가 컨테이너 밖 호스트에서 직접 훈련을 실행 중.
- 워크스페이스가 삭제되었지만 자식 프로세스가 GPU 메모리를 보유 중.
조사하려면:
nvidia-smi --query-compute-apps=pid,process_name,used_memory,gpu_uuid --format=csv해제하려면:
sudo kill -TERM <pid># 30초 후에도 실행 중이면:sudo kill -KILL <pid># Run these as rootkill -TERM <pid># 30초 후에도 실행 중이면:kill -KILL <pid>인스펙터를 조정하거나 비활성화하는 방법은 GPU 구성을 참조하세요.
디스크 압박 배너
섹션 제목: “디스크 압박 배너”설정한 디스크 용량 파일시스템의 사용률이 **90%**를 넘으면 관리자 대시보드에 디스크 압박
배너가 나타납니다. LABPOD_DISK_ROOT의 기본값은 /home입니다. LabPod은 활성 사용자의 유효한
루트리스 Podman graphroot가 있는 별도 파일시스템도 모두 모니터링합니다. 이미지 풀, 쓰기 가능
레이어, 워크스페이스 데이터가 실패하기 전에 조치하세요.
디스크 위생 명령:
du -sh /var/lib/labpod/ # 데이터베이스 + 백업du -sh /var/lib/labpod/backups/ # 백업 파일만sudo -u <user> podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)# Run these as rootdu -sh /var/lib/labpod/ # 데이터베이스 + 백업du -sh /var/lib/labpod/backups/ # 백업 파일만runuser -u <user> -- podman system df # 사용자별 이미지 저장소 (사용자마다 한 번 실행)LabPod에는 root 워크스페이스 이미지 저장소가 없습니다. 관리자의 Monitoring은 읽기 전용입니다. root와 다른 superuser는 사용자별 이미지 사용량과 작업 이력을 볼 수 있지만, 다른 사용자의 이미지를 삭제하거나 prune할 수 없습니다.
일반적인 배포에서 디스크를 가장 많이 차지하는 항목:
- 각 사용자의 유효한 루트리스 Podman graphroot에 있는 컨테이너 이미지
<passwd-home>/work/.hf-cache/또는 별도<LABPOD_WORK_BASE>/<user>/work/.hf-cache/에 있는 Hugging Face 모델 캐시 (LabPod은HF_HOME=/work/.hf-cache로 설정합니다)- 공유 마운트 디렉토리의 데이터셋
모든 사용자의 루트리스 저장소를 다른 로컬 디스크에 두거나 기존 저장소를 안전하게 옮기는 방법은 루트리스 Podman 저장소를 참조하세요. LabPod은 유효 경로를 찾지만 Podman 설정을 수정하거나 레이어를 옮기지 않습니다.
사용량 보고서
섹션 제목: “사용량 보고서”관리자 Usage report 페이지 (/admin/usage, People 아래, 모든 superuser에게 표시)는
사용자별 일별 요약을 보여주고 CSV로 내보낼 수 있습니다.
/api/usage/users/{serverUserID}: 특정 사용자의 일별 통계/api/usage/users/{serverUserID}.csv: CSV 다운로드/api/usage/all.csv: 모든 사용자의 CSV 하나로
보고 기간과 CSV의 day 값은 UTC를 사용합니다. 원시 사용량 샘플은 최소 25시간, 기본값으로 48시간 동안 보관하며 일별 롤업은 무기한 유지됩니다. 차트는 최근 12개월을 보여 주고 연도/월 선택기와 차트 막대를 누르면 해당 월의 일별 상세를 불러옵니다. 런타임 설정의 usage_sample_retention_hours로 원시 샘플 보관 기간을 조정하세요.
감사 로그
섹션 제목: “감사 로그”Audit 페이지 (/admin/audit, 모든 superuser에게 표시)는 모든 변경 사항의 시간순 로그를
표시합니다.
- 사용자 생성 및 삭제
- 워크스페이스 시작, 중지, 소유자가 실행한 삭제 및 관리자 강제 중지
- 워크스페이스 템플릿 및 정책 변경
- 이미지 풀 및 빌드
- 로그인 실패
로그인 실패를 auth.login_failed 저널 항목과 연결하세요:
sudo journalctl -u labpod --since "1 hour ago" | grep login_failed# Run these as rootjournalctl -u labpod --since "1 hour ago" | grep login_failed감사 기록은 기본값으로 무기한 보관합니다. 설치의 보존 정책이 허용하는 경우에만 System → Advanced overrides에서 감사 로그 보관 기간을 양수로 설정해 오래된 감사 기록을 영구적으로 제거할 수 있습니다.