메인 콘텐츠로 건너뛰기
각 노드는 GPU 8개 개요와 함께 GPU, 시스템, 네트워크, InfiniBand 메트릭을 시계열 차트로 보여줘요. Active 클러스터의 Node management 탭에서 노드를 클릭하면 노드 상세 페이지가 열려요.

GPU 개요

각 노드는 GPU 8개를 사용률, VRAM, 온도, 전력과 GPU별 헬스 배지로 보여줘요. 배지 상태가 의미하는 바는 헬스 체크에서 확인할 수 있어요.
노드 상세 페이지 헤더와 GPU 개요: GPU 8개의 사용률, VRAM, 온도, 전력

시간 범위

시간 범위는 1h, 6h, 12h, 1d, 7d, 30d 중에서 고를 수 있어요. 더 깊이 분석하려면 연결된 Grafana 대시보드를 열어 보세요.

메트릭 차트

메트릭은 6개 섹션, 총 25개 차트로 묶여 있어요.

Utilization (2개)

GPU가 실제로 일하고 있는지, 메모리는 얼마나 차 있는지 확인해요.
Utilization 섹션: GPU Utilization과 GPU Memory Used 시계열 차트

System (7개)

GPU 밖의 병목을 찾아요. vCPU 포화, 메모리 압박, 디스크, 네트워크, VM 전반 상태를 한 섹션에서 봐요.
System 섹션(상단): CPU Usage, Load Average, System Memory Usage, Root Disk Usage 차트
System 섹션(이어서): Network RX, Network TX, Node Uptime 차트

Temperature & power (3개)

열·전력 관련 이상 징후와 스로틀링(throttling) 원인을 추적해요.
Temperature & power 섹션: GPU 온도, 메모리 온도, 전력 사용량 차트

Memory & clock detail (3개)

GPU 메모리 엔진 활성도와 클럭 속도로 throttling, 성능 저하를 진단해요.
Memory & clock detail 섹션: 메모리 사용률, 메모리 클럭, SM 클럭 차트

ECC & errors (4개)

GPU 하드웨어 안정성을 모니터링하고, 학습 중단 전에 장애를 조기 감지해요.
ECC & errors 섹션: ECC SBE/DBE와 Remapped Rows 차트

InfiniBand detail (6개)

멀티노드 분산 학습에 쓰는 노드 간 패브릭의 상태를 모니터링해요. 처리량, 에러, 링크 안정성을 한 섹션에서 봐요. 각 차트는 HCA(Host Channel Adapter)별로 그려져요.
InfiniBand detail 섹션: HCA별 처리량·수신·심볼 에러 차트
InfiniBand detail 섹션: IB Link Error Recovery와 IB Link Downed 차트