> ## Documentation Index
> Fetch the complete documentation index at: https://docs.cloud.vessl.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# VM Cluster 이해하기

> GPU 8장부터 빌려 멀티노드 학습을 돌릴 수 있어요. root 권한, InfiniBand, 공유 스토리지를 제공해요.

<Note>
  <strong>VM Cluster는 현재 Beta예요.</strong> 프로덕션 파일럿에 쓸 수 있는 수준이에요. 규모가 크거나 일정이 촉박한 배포라면 [세일즈팀에 문의](https://vessl.ai/ko/talk-to-sales?utm_source=docs\&utm_medium=referral\&utm_campaign=vm_clusters_kr\&utm_content=overview_beta)해 주세요.
</Note>

<strong>VM Cluster</strong>는 고성능 GPU 노드로 구성된 전용 클러스터를 빌려 쓰는 서비스예요. 각 노드에는 GPU가 8개씩 들어 있어요. GPU는 NVIDIA Hopper부터 Blackwell 세대까지(H100, H200, B200, B300) 제공해요. 워크로드에 맞는 클러스터 구성은 [세일즈팀](https://vessl.ai/ko/talk-to-sales?utm_source=docs\&utm_medium=referral\&utm_campaign=vm_clusters_kr\&utm_content=overview_other_gpus)과 함께 정해요. GPU 인프라 운영은 VESSL Cloud가 맡고, 고객은 모든 노드를 root 권한으로 직접 제어할 수 있어요. 노드는 다른 고객과 공유하지 않아요.

<div>
  <Frame>
    <img src="https://mintcdn.com/dora/5t6p_q3y3A1ut21q/images/vm-clusters-list.png?fit=max&auto=format&n=5t6p_q3y3A1ut21q&q=85&s=f623948b1279effdfb03f3ccdf83990c" alt="VM Clusters 페이지: 클러스터 목록과 상태, GPU, 노드 수, 계약 기간" width="1600" height="900" data-path="images/vm-clusters-list.png" />
  </Frame>

  <small>예시: 여러 상태가 함께 보이는 VM Clusters 목록</small>
</div>

## VM Cluster가 필요한 순간

* **멀티노드 분산 학습**: InfiniBand가 기본으로 제공돼서, 데이터 병렬이나 모델 병렬 워크로드에서 노드 간에 고대역폭, 저지연 RDMA 네트워킹을 사용할 수 있어요.
* **완전한 root 제어**: GPU 드라이버를 교체하고, 커스텀 커널 모듈을 올리고, OS를 원하는 대로 구성할 수 있어요.
* **베어메탈에 가까운 GPU 성능**: 각 VM이 GPU를 직접 점유하는 방식(GPU passthrough)으로 연결돼 있어서, 가상화 오버헤드가 거의 없어요.
* **기존 스택 그대로 사용**: Slurm, Kubernetes, 보안 에이전트, 자체 배포 스크립트를 직접 설치해서 쓸 수 있어요. 모든 노드에 root 권한이 주어져요.

## 제공 사양

|             |                                                                                                                                                                                                         |
| ----------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| **형태**      | VM(GPU는 직접 점유), 베어메탈 아님                                                                                                                                                                                 |
| **GPU**     | 노드당 8개                                                                                                                                                                                                  |
| **클러스터 크기** | 멀티노드, 노드당 GPU 8개. 워크로드에 맞춰 [세일즈팀](https://vessl.ai/ko/talk-to-sales?utm_source=docs\&utm_medium=referral\&utm_campaign=vm_clusters_kr\&utm_content=overview_cluster_size)과 함께 정해요                       |
| **OS 이미지**  | Ubuntu 24.04, CUDA 사전 설치                                                                                                                                                                                |
| **네트워킹**    | 노드 간 InfiniBand, 노드당 전용 공인 IP                                                                                                                                                                           |
| **부팅 디스크**  | 노드당 2 TiB                                                                                                                                                                                               |
| **스토리지**    | 선택형 NFS 공유 스토리지, 1-200 TiB                                                                                                                                                                              |
| **접속**      | 모든 노드에 root 권한                                                                                                                                                                                          |
| **계약 기간**   | [세일즈팀](https://vessl.ai/ko/talk-to-sales?utm_source=docs\&utm_medium=referral\&utm_campaign=vm_clusters_kr\&utm_content=overview_contract_length)과 협의해서 정해요. 재부팅이나 **Unhealthy** 상태 구간을 포함한 전체 기간이 과금돼요 |

<Warning>
  <strong>부팅 디스크 데이터는 영구 보관되지 않아요.</strong> 하드웨어 장애 등으로 노드가 재배치되면 부팅 디스크의 모든 데이터가 사라져요. 학습 데이터, 체크포인트, 그 외 중요한 파일은 모든 노드에 마운트되는 <strong>NFS 공유 스토리지</strong>에 보관해 주세요.

  <strong>계약 만료 시점에 모든 데이터가 삭제돼요.</strong> 계약이 끝나면 VM이 모두 종료되고, 부팅 디스크와 NFS 스토리지를 포함한 관련 데이터가 영구 삭제돼요. 별도의 유예 기간은 없어요. 만료 전에 이메일로 미리 안내드리니, 그 사이에 데이터를 백업하거나 [계약을 연장](/ko/vm-clusters/extend-contract)해 주세요.
</Warning>

## 핵심 기능

* **[NFS 공유 스토리지](/ko/vm-clusters/nfs-storage)**: 클러스터의 모든 노드에 마운트되는 공유 파일시스템이에요.
* **[방화벽 규칙](/ko/vm-clusters/firewall-rules)**: 클러스터 전체의 인바운드 접근을 직접 제어할 수 있어요.
* **InfiniBand 기본 제공**: 멀티노드 학습에서 노드 간 통신에 InfiniBand를 사용해요. 단일 노드 클러스터는 InfiniBand를 쓰지 않고, 그 노드의 리소스를 전부 단독으로 사용해요.
* **[헬스 체크](/ko/vm-clusters/health-checks)와 [메트릭](/ko/vm-clusters/metrics)**: 노드별 헬스 판정(GPU, InfiniBand, ECC)과 GPU·시스템 시계열 차트. 1분마다 갱신돼요.
* **[재부팅](/ko/vm-clusters/reboot)**: 필요할 때 VM을 직접 재시작할 수 있어요.

## Workspace와 VM Cluster 비교

개발이나 단일 노드 작업에 컨테이너 환경만 필요하다면, [Workspace](/ko/member/workspace/overview)가 더 빠르게 시작되고 비용도 저렴해요. 커널이나 드라이버 제어, InfiniBand를 쓰는 멀티노드 학습, 또는 기간을 정해 예약한 클러스터가 필요할 때 VM Cluster를 선택하세요. 자세한 비교는 [Workspace와 VM Cluster 비교](/ko/vm-clusters/vs-workspace)에서 확인할 수 있어요.

<Note>
  VM Cluster는 조직(Organization) 레벨 리소스예요. <strong>Admin</strong>이 관리해요.
</Note>

<Card title="VM Cluster 요청하기" icon="server" href="/ko/vm-clusters/order">
  필요한 내용을 알려 주시면 구성을 정하고 준비해 드려요.
</Card>
