추론 토큰의 작동 방식

일반적인 요청에는 두 가지 분명한 측면이 있습니다. 바로 사용자가 보내는 토큰과 모델이 생성하는 출력 토큰입니다. 추론 기능을 지원하는 모델은 생성된 출력을 또 다른 기능 단계로 나눌 수 있습니다.

  1. 입력을 읽습니다.
  2. 작업을 처리하기 위해 추론 토큰을 생성합니다.
  3. 최종 답변을 생성합니다.

이러한 3단계 그림은 유용하지만 보편적인 것은 아닙니다. 일부 모델은 하나의 중단 없는 비공개 스크래치패드를 먼저 완성하는 대신, 도구 호출 사이 또는 화면에 표시되는 출력의 여러 부분 사이에서 추론할 수 있습니다.

여기서 추론이라는 단어는 생성된 토큰이 어떤 용도로 사용되는지를 설명합니다. 이는 다른 모델 연산이 중단되거나 일반 모델이 전혀 추론하지 않는다는 뜻이 아닙니다. 모든 모델은 다음 토큰을 선택하기 위해 수치 연산을 수행합니다. 여기서 특별한 점은 모델이 사용자에게 보여 주려는 토큰을 생성하기 전이나 그 사이에 중간 작업을 위해 생성 토큰을 사용한다는 것입니다.

학습은 이러한 동작을 촉진할 수 있습니다. 예를 들어 강화 학습은 올바른 최종 답변에 보상을 제공하고, 모델이 결과 확인, 전략 변경 또는 이전 단계 재검토와 같은 생성 패턴을 개발하도록 이끌 수 있습니다. 따라서 추론 토큰이 많아진다는 것은 추론 시점의 작업량이 늘어난다는 뜻이지, 학습량이 늘어나거나 모델에 저장된 지식이 변경된다는 뜻은 아닙니다.

숨겨진 추론과 화면에 표시되는 요약은 서로 다릅니다

‘추론 토큰’은 모든 제공업체가 공유하는 표준 용어가 아니라 포괄적인 표현입니다.

OpenAI는 추론 토큰 수를 보고하지만 API를 통해 원시 추론 내용을 공개하지는 않습니다. Google은 사고 과정의 요약과 추론 상태를 나타내는 불투명한 서명을 반환할 수 있습니다. Anthropic의 인터페이스와 제어 방식은 모델에 따라 다르며, 일부 모델은 요약된 사고 과정을 공개하고 일부 모델은 고정된 토큰 예산 대신 적응형 작업량을 사용합니다.

따라서 다음 세 가지를 구분해야 합니다.

  • 원시 추론 토큰: 생성된 중간 작업입니다.
  • 추론 요약: 사용자 또는 개발자를 위해 생성된 더 짧은 설명입니다.
  • 최종 답변: 요청을 완료하기 위한 응답입니다.

요약은 모든 원시 추론 토큰을 그대로 기록한 내용이 아닙니다. 원시 추론 기록을 숨긴다고 해서 해당 토큰이 무료이거나 존재하지 않았다는 뜻도 아닙니다. 요청에 사용된 내용을 확인하려면 화면에 표시된 단어 수를 세지 말고 API의 사용량 메타데이터를 확인하세요.

토큰 사용량 예시

사용량 보고서에 다음과 같이 표시된다고 가정해 보겠습니다.

  • 입력 토큰: 75
  • 총 출력 토큰: 1,186
  • 출력에 포함된 추론 토큰: 1,024

생성된 출력 중 추론에 해당하지 않는 부분은 다음과 같습니다.

1,186 − 1,024 = 162 토큰

이 요청은 답변 토큰 1,186개와 추론 토큰 1,024개를 별도로 사용한 것이 아닙니다. 추론 토큰 1,024개는 이미 출력 총계 1,186개에 포함되어 있습니다.

이러한 구분을 통해 화면에 표시된 텍스트보다 훨씬 큰 출력 수가 기록되었는데도 답변은 간결할 수 있는 이유를 이해할 수 있습니다. 필드 이름은 API마다 다르지만, 응답의 사용량 세부 정보 안에 있는 추론 또는 사고 토큰 수를 찾아보세요.

추론 토큰이 중요한 이유

비용

주요 제공업체는 일반적으로 추론 토큰 또는 사고 토큰에 생성된 출력과 동일한 방식으로 요금을 부과합니다. 따라서 최종 답변이 짧더라도 화면에 표시된 길이만으로 예상한 것보다 비용이 더 많이 들 수 있습니다. 최신 요금과 산정 규칙은 제공업체마다 다르므로 실제 비용을 계산할 때는 해당 제공업체의 가격 및 사용량 문서를 확인하세요.

출력 및 컨텍스트 한도

추론에는 공간이 필요합니다. 제공업체는 일반적으로 추론 토큰을 출력 한도, 컨텍스트 예산 또는 둘 다에 포함합니다. 추론 중 생성 한도를 모두 사용하면 유용한 화면 표시 답변을 생성하기 전에 요청이 종료될 수 있습니다.

따라서 최대 출력 설정을 항상 ‘최대 답변 길이’로 간주할 수는 없습니다. 이 설정은 최종 응답뿐 아니라 중간 추론까지 포함할 수 있어야 합니다. 정확한 규칙은 API마다 다릅니다.

응답 시간

추론 토큰은 생성되는 작업입니다. 일반적으로 추론 토큰이 많을수록 요청이 완료되기 전에 더 많은 순차적 생성이 필요하므로 지연 시간이 늘어날 수 있습니다. 따라서 작업량 설정과 토큰 예산은 단순한 스타일 설정이 아니라 품질, 시간 및 비용 간의 균형을 조정하는 제어 수단입니다.

작업 품질

추가 추론은 여러 단계의 수작업을 필요로 하는 작업에서 가장 유용합니다. 예를 들어 다단계 수학 문제, 코드 디버깅, 계획 수립, 제약 조건 확인 또는 도구 기반 워크플로가 이에 해당합니다. 단순한 추출이나 서식 지정 작업에서는 얻는 이점이 적을 수 있습니다.

추론 토큰이 많다고 해서 항상 더 나은 것은 아닙니다. 모델이 비생산적인 경로에 많은 토큰을 사용하고도 여전히 틀릴 수 있습니다. 추론 토큰 수를 품질 점수로 간주하지 말고, 관심 있는 작업에서 최종 결과를 평가하세요.

흔한 오해

‘추론 토큰은 모델의 비공개 생각이다’

편리한 표현이지만 지나치게 문자 그대로 받아들이면 안 됩니다. 추론 토큰은 모델이 생성하는 중간 시퀀스입니다. 글로 작성된 문제 해결 과정과 비슷하게 보일 수 있지만, 그 존재만으로 인간과 같은 사고, 이해 또는 자기 인식이 입증되는 것은 아닙니다.

‘추론을 볼 수 있다면 원시 토큰을 보고 있는 것이다’

반드시 그렇지는 않습니다. 제품에서 요약이나 필터링된 설명을 보여 줄 수 있습니다. 제공업체 문서에서는 이러한 표시와 사용량 산정에 사용되는 전체 내부 기록을 구분합니다.

‘500토큰 답변은 출력 토큰 500개를 사용한다’

출력에 포함되는 다른 생성 토큰이 없을 때만 그렇습니다. 추론이 활성화된 경우 사용량 총계에는 답변뿐 아니라 숨겨진 추론도 포함될 수 있습니다.

‘예산을 보면 모델이 정확히 몇 개의 토큰을 사용할지 알 수 있다’

제공업체와 모델에 따라 다릅니다. 설정값은 엄격한 최대치, 목표치 또는 작업량 수준일 수 있습니다. 일부 모델은 작업에 따라 추론량을 조절합니다. 반환된 사용량을 측정값으로, 요청 설정을 제어값으로 간주하세요.

다음 단계

추론 토큰을 포함하는 경우가 많은 더 넓은 산정 범주를 이해하려면 출력 토큰이란 무엇인가요?를 읽어 보세요. 그런 다음 하나의 요청에서 세 범주를 모두 비교해야 할 때는 입력 토큰, 출력 토큰, 추론 토큰 비교를 사용하세요.