입력 토큰

입력 토큰은 하나의 요청에 제공되는 콘텐츠를 나타냅니다. 여기에는 시스템 및 개발자 지침, 최신 사용자 메시지, 이전 대화 내용, 검색된 문서, 도구 정의, 도구 결과, 그리고 모델이 지원하는 경우 인코딩된 이미지나 오디오가 포함될 수 있습니다.

“입력”은 누가 작성했는지가 아니라 데이터의 방향을 설명합니다. 사용자가 짧은 문장 하나만 입력하더라도 애플리케이션은 그 주변에 훨씬 더 큰 요청을 조용히 함께 전송할 수 있습니다.

캐시된 입력도 입력입니다. 캐싱은 가격이나 사용량 보고서에 표시되는 방식을 바꿀 수 있지만, 해당 콘텐츠를 출력으로 바꾸거나 모델의 작업 컨텍스트에서 제거하지는 않습니다.

출력 토큰

출력 토큰은 응답을 생성하는 동안 만들어집니다. 화면에 표시되는 일반 텍스트와 코드는 출력이지만, 도구 호출과 같은 생성된 구조도 출력입니다. 제공업체의 용어에 따라 보고된 전체 출력량에는 내부 추론 및 기타 표시되지 않는 생성 토큰이 포함될 수도 있습니다.

따라서 화면에 표시되는 텍스트만으로는 토큰 수를 신뢰성 있게 계산할 수 없습니다. 응답에는 180토큰 분량의 일반 텍스트만 표시되더라도 사용량 기록에는 훨씬 더 많은 생성 토큰이 보고될 수 있습니다.

추론 토큰

추론 토큰은 때때로 사고 토큰이라고도 하며, 추론 모델이 작업을 계획하고 검토하거나 해결하는 동안 내부적으로 생성됩니다. 이는 추가 프롬프트 콘텐츠가 아니며, 사용자에게 반드시 표시되는 것도 아닙니다.

제공업체는 추론 과정을 숨기거나, 생략하거나, 요약을 반환할 수 있습니다. 요약은 처리 과정의 표현일 뿐, 사용자가 모든 내부 추론 토큰을 받았다는 증거는 아닙니다. 현재 OpenAIAnthropicGoogle의 문서는 전체 텍스트가 반환되지 않더라도 내부 작업 전체를 사용량으로 계산합니다.

모든 모델이나 API가 추론 토큰 수를 공개하는 것은 아닙니다. 일부 모델은 별도로 보고되는 추론 단계 없이 답변을 생성합니다. 또 다른 모델은 추론 작업량에 영향을 주는 제어 기능을 지원하지만, 제공업체가 명시적으로 보장하지 않는 한 이러한 제어 기능이 정확한 사고량을 보장하지는 않습니다.

실제 구분

세 가지 레이블은 서로 다른 질문에 답합니다.

Token typeDefining questionTypical contentsUsually visible?Accounting relationship
InputWhat did this request send to the model?Instructions, messages, context, tools, filesMostly, though applications can add contentA top-level request category; cached input may be a priced subset
OutputWhat did the model generate?Answer text, code, tool calls, and sometimes internal generated workPartlyCan be an inclusive total or an answer-only field, depending on the API
ReasoningWhat internal generated work helped produce the answer?Planning, intermediate work, checksOften hidden or summarizedCommonly a subset of generated output for billing, but sometimes reported beside output

입력과 생성된 출력은 하나의 요청에서 서로 반대되는 양쪽입니다. 추론은 생성 활동의 한 종류입니다. 따라서 추론은 입력 및 출력과 나란히 놓이는 보편적인 세 번째 범주가 아닙니다.

이 구분은 제공업체의 대시보드를 비교할 때 중요합니다. OpenAI는 추론을 포괄적인 출력 수에 포함된 세부 항목으로 문서화합니다. Anthropic 역시 사고 토큰을 권위 있는 전체 출력량의 일부로 설명합니다. Google은 후보 출력과 사고 수를 별도로 공개하고, 응답 가격이 이 둘을 결합해 계산된다고 설명합니다. 필드 이름은 서로 다르지만 세 제공업체 모두 추론을 생성된 작업으로 취급합니다.

사용량 예시

다음과 같이 단순화한 요청을 생각해 보겠습니다.

  • 지침, 사용자 메시지, 대화 기록 및 첨부된 컨텍스트의 합계는 입력 토큰 1,200개입니다.
  • 모델은 추론 토큰 620개를 생성합니다.
  • 그런 다음 180토큰 분량의 표시되는 답변을 생성합니다.

어떤 API는 다음과 같이 보고할 수 있습니다.

input_tokens: 1200
output_tokens: 800
output_details.reasoning_tokens: 620

여기서 output_tokens는 포괄적인 값입니다. 620을 다시 더하지 마세요. 180토큰 답변은 생성된 800토큰 중 추론이 아닌 부분입니다.

다른 API는 다음과 같이 보고할 수 있습니다.

input_tokens: 1200
output_tokens: 180
thought_tokens: 620
total_tokens: 2000

여기서는 답변 출력과 사고 토큰이 별도의 필드입니다. 생성된 사용량을 평가할 때 두 항목을 모두 포함해야 합니다. 두 보고서는 동일한 단순화된 흐름을 설명합니다.

1,200 input + 620 reasoning + 180 visible answer = 2,000 total tokens

모든 생성 토큰에 제공업체의 출력 요율이 적용된다면, 단순화한 비용 계산은 다음과 같습니다.

(1,200 × input rate) + (800 × output rate)

실제 청구서에는 캐시된 입력, 캐시 기록, 배치, 도구 또는 기타 기능에 대한 별도 요율이 추가될 수 있습니다. 모든 필드가 합산된다고 가정하지 말고 API의 사용량 스키마와 가격 규칙을 사용하세요.

각 토큰 유형이 중요한 경우

입력 토큰은 요청에 많은 컨텍스트가 포함될 때 중요합니다.긴 대화 기록, 문서, 도구 정의 및 반복되는 지침은 최신 사용자 메시지가 짧더라도 사용량의 대부분을 차지할 수 있습니다. 입력 수를 통해 컨텍스트 윈도우에 얼마나 여유가 남아 있는지도 알 수 있습니다.

출력 토큰은 응답이 길거나 반복적으로 생성될 때 중요합니다.생성은 단계적으로 이루어지므로 출력은 일반적으로 입력과 다른 성능 및 가격 특성을 가집니다. 문서를 하나의 레이블로 분류하는 워크플로와 보고서를 작성하는 워크플로는 사용량 형태가 다릅니다.

추론 토큰은 작업에 내부적인 처리가 필요할 때 중요합니다.짧은 최종 답변도 긴 추론 과정 뒤에 나올 수 있습니다. 이로 인해 비용과 표시되는 답변까지의 지연 시간이 늘어나고, 화면에 표시되는 응답이 더 길어지지 않더라도 생성 토큰 용량이 소모될 수 있습니다.

추론 모델에서는 출력 제한이 내부 추론과 표시되는 응답을 모두 포함할 수 있습니다. 추론이 허용량을 먼저 소모하면 모델이 짧거나 불완전한 답변을 반환할 수 있습니다. 출력 제한을 답변 길이의 보장으로 간주하기 전에 엔드포인트의 문서를 확인하세요.

혼동하기 쉬운 내용

추론 토큰은 추가 입력이 아닙니다

모델은 생성 과정에서 추론 토큰을 만듭니다. 애플리케이션이 보존된 사고 콘텐츠를 다시 전송하면 해당 토큰이 이후 턴의 입력이 될 수 있지만, 이는 새로운 요청이며 새로운 측정 경계를 가집니다.

추론 토큰은 항상 출력 토큰과 별개인 것은 아닙니다

사용량 객체가 추론을 출력 내부의 세부 항목으로 표시한다면 두 필드를 더할 경우 중복 계산이 됩니다. 반대로 사고 토큰을 답변 출력과 나란히 보고한다면 사고 필드를 무시할 경우 사용량을 적게 계산하게 됩니다. 산술 계산을 하기 전에 스키마를 읽으세요.

출력 토큰이 항상 눈에 보이는 단어인 것은 아닙니다

토큰은 단어와 같지 않으며, 생성 사용량은 표시되는 일반 텍스트에만 한정되지 않습니다. 도구 호출 인수, 숨겨진 추론, 제공업체가 관리하는 형식 지정은 모두 사용자가 보는 것과 사용량 측정값 사이의 차이를 키울 수 있습니다.

짧은 답변이 반드시 저렴한 답변인 것은 아닙니다

표시되는 길이는 사용량의 한 부분일 뿐입니다. 요청에는 많은 입력, 상당한 내부 추론 또는 둘 다 포함될 수 있습니다. 측정에는 렌더링된 답변의 크기보다 응답의 사용량 기록이 더 적합한 기준입니다.

다음 단계

애플리케이션이 요청에 무엇을 포함하는지 이해하려면 입력 토큰이란 무엇인가요?를 읽어 보세요. 생성된 응답과 제한을 알아보려면 출력 토큰이란 무엇인가요?를 읽어 보세요. 제공업체에 따라 달라지는 사고 계층을 알아보려면 추론 토큰이란 무엇인가요?를 읽어 보세요.