콘텐츠로 이동

GPU 사용하기

워크스페이스를 생성할 때 GPU 접근 방식을 선택합니다. 사용 가능한 모드는 관리자가 서버에서 활성화한 설정에 따라 달라집니다.

워크스페이스에 GPU 접근 권한이 없습니다. 데이터 준비, CPU 전용 추론, 또는 모든 GPU가 사용 중이고 작업을 대기열에 넣고 싶을 때 적합합니다.

워크스페이스가 하나 이상의 물리적 GPU 전체를 모든 메모리와 연산 자원을 포함해 독점으로 사용합니다. 워크스페이스가 실행 중인 동안 다른 워크스페이스는 해당 GPU를 공유하지 않습니다.

숫자 입력란에서 GPU 수를 설정합니다. 양식에는 현재 여유 전체 GPU 수와 정책 상한이 표시됩니다. 요청한 수가 여유 수를 초과하더라도 워크스페이스를 생성할 수 있습니다. 시작을 클릭하면 GPU가 사용 가능한 시점에 LabPod이 GPU를 할당합니다.

하나의 물리적 GPU를 여러 워크스페이스가 동시에 공유합니다. 워크스페이스에는 VRAM 하드 상한과 연산 시간 소프트 점유율이 부여됩니다. 작업 보존 방식으로 동작합니다. GPU가 유휴 상태이면 워크스페이스는 점유율보다 많은 연산을 사용할 수 있고 상한은 경합이 발생할 때만 적용됩니다.

설정 시 다음을 지정합니다:

  • GPU 메모리 제한: 프로세스가 할당할 수 있는 VRAM의 MB 단위 하드 상한.
  • 연산 제한 (%): 정책 최대치 내에서 GPU 연산 시간 점유율.

관리자가 서버에서 이 모드를 활성화한 경우에만 사용 가능합니다. 워크스페이스 상세 페이지에 VRAM 바가 표시되어 한도에 얼마나 가까운지 확인할 수 있습니다.

A100 또는 H100 GPU를 하드웨어적으로 분할한 슬라이스로, 전용 메모리와 연산 엔진을 가집니다. 소프트웨어 제한이 아니라 물리적으로 격리됩니다. 워크스페이스가 해당 슬라이스를 독점으로 사용합니다.

슬라이스는 관리자가 미리 구성합니다. 각 슬라이스에는 1g.10gb (GPU 인스턴스 1개, 메모리 10 GB)와 같은 프로필 이름이 있습니다. 양식에는 여유 슬롯이 있는 슬라이스 크기가 표시됩니다. 이 모드는 서버에 MIG 지원 GPU가 있고 관리자가 슬라이스를 프로비저닝한 경우에만 사용 가능합니다.

워크스페이스 생성 양식에는 가벼운 / 보통 / 무거운 선택기가 있어 최적의 사용 가능 모드를 자동으로 선택합니다:

사용 사례선택 결과
가벼운 (노트북, 소형 모델, 빠른 실험)사용 가능한 가장 작은 GPU 슬라이스 또는 가장 작은 공유 GPU 분할
보통 (파인튜닝, 중간 크기 추론)더 큰 공유 GPU 분할, 또는 공유가 불가능한 경우 전체 GPU
무거운 (대형 모델 학습, 장시간 작업)전체 GPU

정밀하게 제어하려면 양식 내 고급: 정확한 GPU 모드 선택을 펼칩니다.

워크스페이스 내에서 GPU 확인하기

섹션 제목: “워크스페이스 내에서 GPU 확인하기”
Terminal window
nvidia-smi # see the GPU, VRAM, running processes
python -c "import torch; print(torch.cuda.is_available())"

공유 GPU의 경우 nvidia-smi는 전체 카드를 표시하지만 프로세스는 워크스페이스 생성 시 설정된 VRAM 한도에 따라 제한됩니다. 워크스페이스 상세 페이지에서 현재 VRAM 사용량을 확인할 수 있습니다.

DataLoader와 DDP를 위한 /dev/shm 크기 설정

섹션 제목: “DataLoader와 DDP를 위한 /dev/shm 크기 설정”

LabPod은 컨테이너의 /dev/shm워크스페이스 메모리 제한의 절반으로 설정합니다 (Podman 기본값 64 MB 대신). 이렇게 설정하면:

  • torch.utils.data.DataLoader(num_workers > 0)Bus error 없이 동작합니다.
  • 단일 컨테이너에서 여러 GPU를 쓰는 DDP 학습이 NCCL의 공유 메모리 전송으로 추가 플래그 없이 동작합니다.