> ## Documentation Index
> Fetch the complete documentation index at: https://docs.cloud.vessl.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Provisioned Throughput 이해하기

> 모델 서빙 용량을 PTU 단위로 예약해 보장된 처리량과 SLA를 받을 수 있어요. OpenAI, Anthropic 호환 엔드포인트를 제공해요.

<strong>Provisioned Throughput</strong>은 모델 서빙 용량을 PTU(Provisioned Throughput Unit)라는 계약 단위로 예약해서 쓰는 VESSL Cloud의 인퍼런스(inference) 서비스예요. VESSL Cloud가 모델을 대신 운영하면서 계약한 만큼의 처리량(분당 토큰 수, TPM)과 SLA를 함께 보장해요. 그래서 트래픽이 크고 예측 가능한 워크로드라면, 인퍼런스 인프라를 직접 운영하지 않아도 프로덕션에 필요한 응답 속도를 지킬 수 있어요.

## Provisioned Throughput이 필요한 순간

* **처리량 보장**: 계약한 처리량(분당 토큰 수, TPM)은 인프라가 붐빌 때도 그대로 유지돼요. 최대한 맞춰 보는 목표치가 아니라, 계약으로 보장하는 수치예요.
* **운영 부담 없는 SLA**: 계약에 명시된 처리량, 안정성, 지연 시간 목표에 맞춰 VESSL Cloud가 서빙 스택을 운영해요. 지연 시간은 출력 토큰 하나당 시간(TPOT, Time per Output Token)으로 측정해요.
* **더 낮은 토큰당 비용**: 동급의 프론티어(frontier) 모델보다 평균 약 <strong>70%</strong> 낮은 가격이라 LLM 운영 비용을 줄일 수 있어요. 실제 트래픽 기준 수치는 모델 페이지의 **Estimate total cost** 계산기에서 확인할 수 있어요.

## 이런 기업에 맞아요

* **모델 프로바이더**: 고객 수요가 늘어나는 만큼 서빙 용량을 단계적으로 키워야 하는 경우
* **엔터프라이즈**: 전사적으로 AI 에이전트를 도입하면서, 오픈소스 모델로 내부 운영 비용을 줄이고 싶은 경우
* **AI 서비스 기업**: 사업이 커지는 만큼 트래픽을 안정적으로 처리하고 싶은 경우

## 제공 내용

|            |                                                                                                                          |
| ---------- | ------------------------------------------------------------------------------------------------------------------------ |
| **용량 단위**  | PTU. 모델과 관계없이 같은 기준으로 서빙 용량을 세는 단위예요. [PTU와 과금 이해하기](/ko/inference/ptu)를 참고하세요.                                          |
| **가격**     | PTU당 분당 \$0.05이고, 모든 모델에 같은 단가가 적용돼요.                                                                                    |
| **PTU 수량** | 세일즈팀과 개별 협의해서 정해요.                                                                                                       |
| **계약 기간**  | 세일즈팀과 개별 협의해서 정해요. 월 단위로 정산해요.                                                                                           |
| **모델**     | MiniMax M3, GLM 5.2. [모델 살펴보기](/ko/inference/models)를 참고하세요.                                                             |
| **모델 교체**  | 계약 기간 중 같은 모델 패밀리 안에서 다른 모델로 바꿀 수 있어요. [계약 관리하기](/ko/inference/contracts)를 참고하세요.                                        |
| **API**    | OpenAI Chat Completions API, Anthropic Messages API와 호환돼요. [첫 요청 보내기](/ko/inference/send-requests)를 참고하세요.               |
| **SLA**    | 처리량, 안정성, 지연 시간 목표치를 계약에서 정해요. [SLA 이해하기](/ko/inference/sla)를 참고하세요.                                                     |
| **데이터 보관** | 기본적으로 프롬프트와 출력을 저장하지 않아요(zero data retention). 콘텐츠 로깅에 직접 동의한 경우에만 저장해요. [Inference 서비스 약관](/ko/legal/inference)을 참고하세요. |

## 진행 방식

1. **상담**: 모델, 트래픽 규모와 패턴, 목표 SLA를 함께 살펴봐요.
2. **계약**: 보장 TPM, SLA, 가격을 확정하고 계약 조건을 협의해요.
3. **PoC(Proof of Concept)**: 샘플 API Key로 실 트래픽을 벤치마크하고 성능과 비용을 확인해요.
4. **엔드포인트 제공과 운영**: OpenAI, Anthropic 호환 엔드포인트가 열리고, 대시보드에서 사용량과 성능을 모니터링하면서 월 단위로 정산해요.

## 다른 서비스 유형과 비교

Provisioned Throughput은 서버리스와 전용 엔드포인트의 중간 위치에 있는 상품이에요. 하드웨어를 직접 운영하지 않아도, 공개된 모델을 그대로 쓰면서 용량은 보장받을 수 있어요. [인퍼런스 서비스 유형 비교하기](/ko/inference/vs-service-types)를 참고하세요.

## 주요 페이지

* **[모델 살펴보기](/ko/inference/models)**: Provisioned Throughput으로 쓸 수 있는 모델과 모델 페이지 구성
* **[첫 요청 보내기](/ko/inference/send-requests)**: base URL, 인증, 요청 예시
* **[인퍼런스 상태 모니터링하기](/ko/inference/monitor-usage)**: 토큰 사용량, 비용 구성, 성능, 안정성
* **[계약 관리하기](/ko/inference/contracts)**: 예약 PTU, 계약 기간, 모델 교체, 계약 이력

<Card title="Provisioned Throughput 요청하기" icon="bolt" href="/ko/inference/request">
  트래픽을 알려 주시면 용량을 함께 정해 드려요.
</Card>
