비교
VESSL Cloud가 지금 제공하는 인퍼런스 서비스는 Provisioned Throughput이에요. Serverless Endpoint는 준비 중이에요. 표의 서버리스와 전용 엔드포인트 열은 여러 인퍼런스 프로바이더에서 볼 수 있는 서비스 유형을 설명한 것으로, Provisioned Throughput의 위치를 이해하는 데 참고해 주세요.
Provisioned Throughput이 적합한 경우
- 트래픽이 크고 예측 가능해서, 다른 사용자의 트래픽에 따라 바뀌는 요청 한도 대신 계획을 세울 수 있는 최소 처리량이 필요해요.
- 공개된 오픈 웨이트(open-weight) 모델을 그대로 쓰고, 특정 하드웨어 구성이나 파인튜닝한 체크포인트는 필요하지 않아요.
- GPU와 서빙 엔진, 오토스케일링을 직접 운영하는 대신 처리량, 안정성, 지연 시간을 SLA로 보장받고 싶어요.
- 같은 사용량 기준으로 프론티어(frontier) 폐쇄형 모델 API보다 낮으면서 예측 가능한 토큰당 비용이 필요해요.
다른 유형이 더 적합한 경우
- 서버리스: 프로토타이핑 중이거나, 트래픽이 너무 들쭉날쭉하고 사용량이 적어서 약정이 부담스러운 경우예요. 쓴 토큰만큼만 내는 대신 성능은 그때그때 상황에 따라 달라져요.
- 전용 엔드포인트: 직접 파인튜닝한 모델을 서빙하거나, 특정 하드웨어 구성이 필요하거나, 서빙 스택을 직접 튜닝해야 하는 경우예요. GPU를 빌리고 운영도 직접 맡아요.