Skip to main content
Provisioned Throughput은 모델 서빙 용량을 PTU(Provisioned Throughput Unit)라는 계약 단위로 예약해서 쓰는 VESSL Cloud의 인퍼런스(inference) 서비스예요. VESSL Cloud가 모델을 대신 운영하면서 계약한 만큼의 처리량(분당 토큰 수, TPM)과 SLA를 함께 보장해요. 그래서 트래픽이 크고 예측 가능한 워크로드라면, 인퍼런스 인프라를 직접 운영하지 않아도 프로덕션에 필요한 응답 속도를 지킬 수 있어요.

Provisioned Throughput이 필요한 순간

  • 처리량 보장: 계약한 처리량(분당 토큰 수, TPM)은 인프라가 붐빌 때도 그대로 유지돼요. 최대한 맞춰 보는 목표치가 아니라, 계약으로 보장하는 수치예요.
  • 운영 부담 없는 SLA: 계약에 명시된 처리량, 안정성, 지연 시간 목표에 맞춰 VESSL Cloud가 서빙 스택을 운영해요. 지연 시간은 출력 토큰 하나당 시간(TPOT, Time per Output Token)으로 측정해요.
  • 더 낮은 토큰당 비용: 동급의 프론티어(frontier) 모델보다 평균 약 70% 낮은 가격이라 LLM 운영 비용을 줄일 수 있어요. 실제 트래픽 기준 수치는 모델 페이지의 Estimate total cost 계산기에서 확인할 수 있어요.

이런 기업에 맞아요

  • 모델 프로바이더: 고객 수요가 늘어나는 만큼 서빙 용량을 단계적으로 키워야 하는 경우
  • 엔터프라이즈: 전사적으로 AI 에이전트를 도입하면서, 오픈소스 모델로 내부 운영 비용을 줄이고 싶은 경우
  • AI 서비스 기업: 사업이 커지는 만큼 트래픽을 안정적으로 처리하고 싶은 경우

제공 내용

진행 방식

  1. 상담: 모델, 트래픽 규모와 패턴, 목표 SLA를 함께 살펴봐요.
  2. 계약: 보장 TPM, SLA, 가격을 확정하고 계약 조건을 협의해요.
  3. PoC(Proof of Concept): 샘플 API Key로 실 트래픽을 벤치마크하고 성능과 비용을 확인해요.
  4. 엔드포인트 제공과 운영: OpenAI, Anthropic 호환 엔드포인트가 열리고, 대시보드에서 사용량과 성능을 모니터링하면서 월 단위로 정산해요.

다른 서비스 유형과 비교

Provisioned Throughput은 서버리스와 전용 엔드포인트의 중간 위치에 있는 상품이에요. 하드웨어를 직접 운영하지 않아도, 공개된 모델을 그대로 쓰면서 용량은 보장받을 수 있어요. 인퍼런스 서비스 유형 비교하기를 참고하세요.

주요 페이지

Provisioned Throughput 요청하기

트래픽을 알려 주시면 용량을 함께 정해 드려요.