> ## Documentation Index
> Fetch the complete documentation index at: https://docs.cloud.vessl.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# SLA 이해하기

> Provisioned Throughput SLA가 무엇을 보장하는지, 어떤 요청이 적용 대상인지, 용량을 초과하는 트래픽은 어떻게 처리되는지 정리했어요.

SLA는 구매한 PTU(Provisioned Throughput Unit) 용량과 서비스 한도 안에서 들어온 요청에 적용되고, 아래 세 가지를 보장해요.

## SLA 보장 항목

|                      |                                                                                                         |
| -------------------- | ------------------------------------------------------------------------------------------------------- |
| **처리량(Throughput)**  | 선택한 모델(또는 모델 패밀리)에서, 구매한 PTU가 보장하는 최대 처리량(분당 토큰 수, TPM)까지 요청을 처리해요.                                     |
| **안정성(Reliability)** | 매월 SLA 적용 대상 요청 가운데 정해진 비율 이상이 정상 처리돼요. VESSL Cloud 측 문제로 실패한 요청은 실패로 집계하고, 고객 측 오류로 실패한 요청은 집계에서 제외해요. |
| **지연 시간(Latency)**   | 출력 토큰 하나당 시간(TPOT, Time per Output Token)의 목표치예요.                                                       |

<Info>
  구체적인 목표치와 미달 시 보상은 계약할 때 Custom SLA Addendum으로 협의해요.
</Info>

## SLA가 적용되는 요청

구매한 PTU 용량과 서비스 한도 안에서 들어온 요청은 모두 SLA 적용 대상이에요. 아래 요청은 제외돼요.

* 고객 측 오류, 잘못된 요청, 인증 실패
* 클라이언트가 취소한 요청
* 구매 용량을 초과한 트래픽
* 어뷰징 방지 한도나 서비스 보호 한도를 넘은 요청

## 용량을 초과하는 트래픽

계약한 용량을 넘는 트래픽도 정해진 한도까지는 처리해요. 다만 이 구간은 처리량을 보장하지 않는(best-effort) 방식이라 SLA 적용 대상이 아니에요. 용량을 늘리려면 [세일즈팀에 문의](https://vessl.ai/ko/talk-to-sales?utm_source=docs\&utm_medium=referral\&utm_campaign=inference_kr\&utm_content=sla_more_capacity)해 주세요.

## 사용량과 성능 확인하기

모델별 사용량과 성능은 모델 페이지와 <strong>Monitoring Dashboard</strong>에서 볼 수 있어요. [인퍼런스 상태 모니터링하기](/ko/inference/monitor-usage)를 참고하세요.
