메인 콘텐츠로 건너뛰기
클러스터의 모든 노드는 1분마다 헬스 체크를 거쳐요. 각 GPU는 개별 헬스 상태를 갖고, 노드 레벨 조건(메모리, 디스크, 커널 모듈, InfiniBand, 관측 공백)은 한데 모여서 노드 종합 상태로 표시돼요.

노드 개요

클러스터 상세 페이지의 Node overview 영역에서 각 노드가 색깔 셀로 표시돼서 클러스터 전체 헬스를 한눈에 볼 수 있어요.

헬스 상태

노드 헬스 상태는 worst-wins 규칙을 따라요. 모든 알람과 GPU별 상태 중 가장 심각한 색으로 표시돼요. 경고가 많다고 Critical로 올라가지 않아요.

레벨

헬스는 두 레벨에서 추적돼요. 각 GPU가 자체 상태를 갖고, 노드는 자체 점검 항목과 가장 심한 GPU 상태를 합쳐서 종합 상태를 가져요.

GPU 점검

GPU별 색은 아래 조건 중 가장 심각한 것을 따라요. 노드는 worst-wins로 가장 심한 GPU 색을 가져가요.

XID 오류

GPU XID 코드는 심각도별로 분류돼요. 표에 없는 코드는 NVIDIA XID 카탈로그에서 확인할 수 있어요. 노드 상세 페이지의 각 XID 알림은 카탈로그 항목으로 연결돼요.

노드 점검

노드 헬스 상태에 영향을 주는 조건이에요. 노드 dot과 Node overview 칸을 바꿀 뿐, 개별 GPU 상태는 건드리지 않아요. 클러스터 상세 페이지에서 노드 헬스 표시기에 마우스를 올리면 어떤 알람이 발동했는지 툴팁으로 확인할 수 있어요.

시스템·커널

InfiniBand

관측 공백(Observability gap)

노드의 헬스 데이터 일부가 수집되지 않을 때, 노드는 어떤 부분이 빠졌는지 알리는 라벨과 함께 Warning으로 표시돼요. 데이터 일부가 누락된다고 노드가 Unknown으로 바뀌지는 않아요. 회색은 아래 두 경우에만 써요.

Unknown (회색)

노드 헬스를 아예 판정할 수 없을 때만 Unknown(⚪)으로 표시돼요. 두 가지 경우예요.
  • 노드가 Rebooting 상태예요. 노드가 완전히 기동하기 전엔 판정하지 않아요. 재부팅이나 초기 프로비저닝 중에 정상으로 보이는 상태예요.
  • 노드가 모니터링 시스템에 등록되어 있지 않아요. 흔치 않은 경우라, Running 노드가 이 상태로 계속 머물면 고객지원에 문의해 주세요.
이 경우 노드 상세 페이지의 모든 칸과 노드 dot이 회색으로 표시돼요.

노드가 정상이 아닐 때

  • 노드 재부팅하기: 일시적인 오류는 재부팅으로 해결되는 경우가 많아요.
  • 복구 대기: VESSL 엔지니어가 노드를 모니터링하면서 직접 복구해요. Beta 기간에는 복구 시간 SLA가 없어요.
  • 문제가 계속되면 고객지원에 문의하세요.
하드웨어 문제로 노드에 장애가 생기면 엔지니어가 노드를 교체할 수 있어요. 교체는 자동이 아니라 수동으로 결정해요. 현재 정해진 점검 일정은 없고, 점검이 필요하면 미리 안내해 드릴게요.