메인 콘텐츠로 건너뛰기
VM Cluster는 현재 Beta예요. 프로덕션 파일럿에 쓸 수 있는 수준이에요. 규모가 크거나 일정이 촉박한 배포라면 세일즈팀에 문의해 주세요.
VM Cluster(VMaaS, VM as a Service)는 고성능 GPU 노드로 구성된 전용 클러스터를 빌려 쓰는 서비스예요. 노드는 1-8개까지 선택할 수 있고, 각 노드에는 GPU가 8개씩 들어 있어요. GPU는 NVIDIA Hopper부터 Blackwell 세대까지(H100, H200, B200, GB200, B300, GB300) 제공해요. 셀프서비스로 제공되지 않는 옵션은 세일즈팀에 문의해 주세요. GPU 인프라 운영은 VESSL Cloud가 맡고, 고객은 모든 노드를 root 권한으로 직접 제어할 수 있어요. 노드는 다른 고객과 공유하지 않아요.
VM Clusters 페이지: 클러스터 목록과 Active, Provisioning, In review, Confirmed 상태, GPU, 노드 수, 계약 기간

VM Cluster가 필요한 순간

  • 멀티노드 분산 학습: InfiniBand가 기본으로 제공돼서, 데이터 병렬이나 모델 병렬 워크로드에서 노드 간에 고대역폭, 저지연 RDMA 네트워킹을 사용할 수 있어요.
  • 완전한 root 제어: GPU 드라이버를 교체하고, 커스텀 커널 모듈을 올리고, OS를 원하는 대로 구성할 수 있어요.
  • 베어메탈에 가까운 GPU 성능: 각 VM이 GPU를 직접 점유하는 방식(GPU passthrough)으로 연결돼 있어서, 가상화 오버헤드가 거의 없어요.
  • 기존 스택 그대로 사용: Slurm, Kubernetes, 보안 에이전트, 자체 배포 스크립트를 직접 설치해서 쓸 수 있어요. 모든 노드에 root 권한이 주어져요.

제공 사양

부팅 디스크 데이터는 영구 보관되지 않아요. 하드웨어 장애 등으로 노드가 재배치되면 부팅 디스크의 모든 데이터가 사라져요. 학습 데이터, 체크포인트, 그 외 중요한 파일은 모든 노드에 마운트되는 NFS 공유 스토리지에 보관해 주세요.계약 만료 시점에 모든 데이터가 삭제돼요. 계약이 끝나면 VM이 모두 종료되고, 부팅 디스크와 NFS 스토리지를 포함한 관련 데이터가 영구 삭제돼요. 별도의 유예 기간은 없어요. 만료 전에 이메일로 미리 안내드리니, 그 사이에 데이터를 백업하거나 계약을 연장해 주세요.

핵심 기능

  • NFS 공유 스토리지: 클러스터의 모든 노드에 마운트되는 공유 파일시스템이에요.
  • 방화벽 규칙: 클러스터 전체의 인바운드 접근을 직접 제어할 수 있어요.
  • InfiniBand 기본 제공: 멀티노드 학습에서 노드 간 통신에 InfiniBand를 사용해요. 단일 노드 클러스터는 InfiniBand를 쓰지 않고, 그 노드의 리소스를 전부 단독으로 사용해요.
  • 헬스 체크메트릭: 노드별 헬스 판정(GPU, InfiniBand, ECC)과 GPU·시스템 시계열 차트. 1분마다 갱신돼요.
  • 재부팅: 필요할 때 VM을 직접 재시작할 수 있어요.

Workspace와 VM Cluster 비교

개발이나 단일 노드 작업에 컨테이너 환경만 필요하다면, Workspace가 더 빠르게 시작되고 비용도 저렴해요. 커널이나 드라이버 제어, InfiniBand를 쓰는 멀티노드 학습, 또는 기간을 정해 예약한 클러스터가 필요할 때 VM Cluster를 선택하세요. 자세한 비교는 Workspace와 VM Cluster 비교에서 확인할 수 있어요.
VM Cluster는 조직(Organization) 레벨 리소스예요. Admin만 새로 만들 수 있어요.

VM Cluster 주문하기

주문서 작성 방법과 제출 후 진행 과정을 안내해요.