Skip to main content
인퍼런스 서비스는 보통 세 가지 유형으로 나뉘어요. Provisioned Throughput은 나머지 두 유형의 중간 위치에 있는 상품이에요. GPU를 직접 빌려서 운영하지 않아도, 공개된 모델을 그대로 쓰면서 보장된 용량을 미리 예약할 수 있어요.

비교

VESSL Cloud가 지금 제공하는 인퍼런스 서비스는 Provisioned Throughput이에요. Serverless Endpoint는 준비 중이에요. 표의 서버리스와 전용 엔드포인트 열은 여러 인퍼런스 프로바이더에서 볼 수 있는 서비스 유형을 설명한 것으로, Provisioned Throughput의 위치를 이해하는 데 참고해 주세요.

Provisioned Throughput이 적합한 경우

  • 트래픽이 크고 예측 가능해서, 다른 사용자의 트래픽에 따라 바뀌는 요청 한도 대신 계획을 세울 수 있는 최소 처리량이 필요해요.
  • 공개된 오픈 웨이트(open-weight) 모델을 그대로 쓰고, 특정 하드웨어 구성이나 파인튜닝한 체크포인트는 필요하지 않아요.
  • GPU와 서빙 엔진, 오토스케일링을 직접 운영하는 대신 처리량, 안정성, 지연 시간을 SLA로 보장받고 싶어요.
  • 같은 사용량 기준으로 프론티어(frontier) 폐쇄형 모델 API보다 낮으면서 예측 가능한 토큰당 비용이 필요해요.

다른 유형이 더 적합한 경우

  • 서버리스: 프로토타이핑 중이거나, 트래픽이 너무 들쭉날쭉하고 사용량이 적어서 약정이 부담스러운 경우예요. 쓴 토큰만큼만 내는 대신 성능은 그때그때 상황에 따라 달라져요.
  • 전용 엔드포인트: 직접 파인튜닝한 모델을 서빙하거나, 특정 하드웨어 구성이 필요하거나, 서빙 스택을 직접 튜닝해야 하는 경우예요. GPU를 빌리고 운영도 직접 맡아요.
공개 모델을 그대로 프로덕션 규모로 서빙한다면 Provisioned Throughput 요청하기를 참고하세요.