Provisioned Throughput이 필요한 순간
- 처리량 보장: 계약한 처리량(분당 토큰 수, TPM)은 인프라가 붐빌 때도 그대로 유지돼요. 최대한 맞춰 보는 목표치가 아니라, 계약으로 보장하는 수치예요.
- 운영 부담 없는 SLA: 계약에 명시된 처리량, 안정성, 지연 시간 목표에 맞춰 VESSL Cloud가 서빙 스택을 운영해요. 지연 시간은 출력 토큰 하나당 시간(TPOT, Time per Output Token)으로 측정해요.
- 더 낮은 토큰당 비용: 동급의 프론티어(frontier) 모델보다 평균 약 70% 낮은 가격이라 LLM 운영 비용을 줄일 수 있어요. 실제 트래픽 기준 수치는 모델 페이지의 Estimate total cost 계산기에서 확인할 수 있어요.
이런 기업에 맞아요
- 모델 프로바이더: 고객 수요가 늘어나는 만큼 서빙 용량을 단계적으로 키워야 하는 경우
- 엔터프라이즈: 전사적으로 AI 에이전트를 도입하면서, 오픈소스 모델로 내부 운영 비용을 줄이고 싶은 경우
- AI 서비스 기업: 사업이 커지는 만큼 트래픽을 안정적으로 처리하고 싶은 경우
제공 내용
진행 방식
- 상담: 모델, 트래픽 규모와 패턴, 목표 SLA를 함께 살펴봐요.
- 계약: 보장 TPM, SLA, 가격을 확정하고 계약 조건을 협의해요.
- PoC(Proof of Concept): 샘플 API Key로 실 트래픽을 벤치마크하고 성능과 비용을 확인해요.
- 엔드포인트 제공과 운영: OpenAI, Anthropic 호환 엔드포인트가 열리고, 대시보드에서 사용량과 성능을 모니터링하면서 월 단위로 정산해요.
다른 서비스 유형과 비교
Provisioned Throughput은 서버리스와 전용 엔드포인트의 중간 위치에 있는 상품이에요. 하드웨어를 직접 운영하지 않아도, 공개된 모델을 그대로 쓰면서 용량은 보장받을 수 있어요. 인퍼런스 서비스 유형 비교하기를 참고하세요.주요 페이지
- 모델 살펴보기: Provisioned Throughput으로 쓸 수 있는 모델과 모델 페이지 구성
- 첫 요청 보내기: base URL, 인증, 요청 예시
- 인퍼런스 상태 모니터링하기: 토큰 사용량, 비용 구성, 성능, 안정성
- 계약 관리하기: 예약 PTU, 계약 기간, 모델 교체, 계약 이력
Provisioned Throughput 요청하기
트래픽을 알려 주시면 용량을 함께 정해 드려요.