> ## Documentation Index
> Fetch the complete documentation index at: https://docs.cloud.vessl.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 인퍼런스 서비스 유형 비교하기

> 업계에서 제공하는 서버리스, 전용 엔드포인트와 Provisioned Throughput이 어떻게 다른지 정리했어요.

인퍼런스 서비스는 보통 세 가지 유형으로 나뉘어요. <strong>Provisioned Throughput</strong>은 나머지 두 유형의 중간 위치에 있는 상품이에요. GPU를 직접 빌려서 운영하지 않아도, 공개된 모델을 그대로 쓰면서 보장된 용량을 미리 예약할 수 있어요.

## 비교

|            | Provisioned Throughput                                     | 서버리스                                                | 전용 엔드포인트                                        |
| ---------- | ---------------------------------------------------------- | --------------------------------------------------- | ----------------------------------------------- |
| **예약 대상**  | 선택한 모델(또는 모델 패밀리)의 약정 용량                                   | 없음. 공유 자원을 사용해요.                                    | 고객 전용으로 예약된 GPU                                 |
| **과금 단위**  | 세일즈팀과 협의한 계약 기간 동안 PTU(Provisioned Throughput Unit) 단위로 과금 | 토큰당, 초당, 또는 출력 단위당                                  | 예약된 하드웨어의 분당 과금                                 |
| **SLA**    | 계약에서 정한 처리량, 안정성, 지연 시간 목표치                                | 보장 없음(best-effort). 요청 한도(rate limit)가 상황에 따라 바뀌어요. | 공유 인프라의 요청 한도는 없고, 성능은 하드웨어 구성과 설정에 따라 달라져요.    |
| **적합한 용도** | 공개 모델을 그대로 쓰는 프로덕션 워크로드                                    | 프로토타이핑, 변동성이 큰 트래픽                                  | 파인튜닝한 모델, 특정 하드웨어 구성, 지연 시간과 처리량을 세밀하게 제어해야 할 때 |
| **이용 방법**  | 세일즈팀 문의                                                    | 직접 신청(self-serve)                                   | 직접 신청                                           |

<Note>
  VESSL Cloud가 지금 제공하는 인퍼런스 서비스는 Provisioned Throughput이에요. <strong>Serverless Endpoint</strong>는 준비 중이에요. 표의 서버리스와 전용 엔드포인트 열은 여러 인퍼런스 프로바이더에서 볼 수 있는 서비스 유형을 설명한 것으로, Provisioned Throughput의 위치를 이해하는 데 참고해 주세요.
</Note>

## Provisioned Throughput이 적합한 경우

* 트래픽이 크고 예측 가능해서, 다른 사용자의 트래픽에 따라 바뀌는 요청 한도 대신 계획을 세울 수 있는 최소 처리량이 필요해요.
* 공개된 오픈 웨이트(open-weight) 모델을 그대로 쓰고, 특정 하드웨어 구성이나 파인튜닝한 체크포인트는 필요하지 않아요.
* GPU와 서빙 엔진, 오토스케일링을 직접 운영하는 대신 처리량, 안정성, 지연 시간을 SLA로 보장받고 싶어요.
* 같은 사용량 기준으로 프론티어(frontier) 폐쇄형 모델 API보다 낮으면서 예측 가능한 토큰당 비용이 필요해요.

## 다른 유형이 더 적합한 경우

* **서버리스**: 프로토타이핑 중이거나, 트래픽이 너무 들쭉날쭉하고 사용량이 적어서 약정이 부담스러운 경우예요. 쓴 토큰만큼만 내는 대신 성능은 그때그때 상황에 따라 달라져요.
* **전용 엔드포인트**: 직접 파인튜닝한 모델을 서빙하거나, 특정 하드웨어 구성이 필요하거나, 서빙 스택을 직접 튜닝해야 하는 경우예요. GPU를 빌리고 운영도 직접 맡아요.

공개 모델을 그대로 프로덕션 규모로 서빙한다면 [Provisioned Throughput 요청하기](/ko/inference/request)를 참고하세요.
