AI 업계는 2026년 상반기 내내 어떤 모델이 가장 똑똑한지를 두고 논쟁했다. 그러나 가장 큰 고객들이 던져온 질문은 더 좁았고, 청구서에 그대로 찍히는 질문이었다. 그 지능 1단위의 비용은 얼마인가?

OpenAI는 목요일 그 질문의 일부에 답하며, 최신 모델군에서 가장 빠르고 가장 저렴한 모델인 GPT-5.6 Luna의 가격을 약 80% 인하했다. Luna의 가격은 이제 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20이다. 중간급 모델인 GPT-5.6 Terra는 20% 내려 각각 $2와 $12가 됐다. 플래그십인 GPT-5.6 Sol은 각각 $5와 $30으로 변동이 없다. 이번 인하는 이 모델군이 7월 9일 일반 제공된 지 3주 만에 이뤄졌다.

이례적인 점은 그 속도다. Ina Fried는 Axios에 인하 소식을 보도하며 이런 종류의 할인은 보통 모델 출시 후 몇 주가 아니라 몇 달이 지나서야 나온다고 지적했다.

토큰은 AI 모델의 과금 단위로, 각각 대략 단어 4분의 3 정도에 해당한다. 입력 토큰은 사용자가 보내는 것이고, 출력 토큰은 모델이 다시 써서 보내는 것이다. 단일 자동화 코딩 작업만으로도 반나절 사이 인터페이스를 통해 수백만 개의 토큰이 오갈 수 있다. 이것이 지난 몇 달간의 가격 책정 뉴스 뒤에 있는 압력이다. OpenAI와 Anthropic 모두 요율, 요율 제한, 사용 정책을 재조정해왔고 더 새로운 추론 모델은 장시간 작업에서 이전 세대보다 훨씬 더 많은 토큰을 소비하고 있다.

OpenAI는 모델 자체가 운영 비용 절감에 도움을 줬다고 말한다

가격 변경 하루 전인 수요일, OpenAI는 비용 절감의 출처를 설명하는 엔지니어링 게시물을 공개했다. 지금까지 대형 모델의 서빙 비용은 주로 두 가지 지렛대를 통해 낮아졌다. 더 나은 하드웨어, 그리고 그 위에서 돌아가는 소프트웨어를 인간 엔지니어가 손으로 미세 조정하는 방식이다. OpenAI의 주장은 이제 세 번째 지렛대가 열렸다는 것이다.

회사는 Codex 코딩 도구 내부에서 "GPT-5.6 Sol이 자율적으로 우리의 프로덕션 커널을 다시 쓰고 최적화했다"고 썼다. 커널은 그래픽 칩에서 모델의 수학 연산을 실행하는 저수준 코드다. OpenAI는 이 작업이 관련 변경 사항들과 결합돼 엔드투엔드 서빙 비용을 20% 낮췄다고 밝혔다.

이 분야 밖의 독자에게 중요한 점은 엔지니어링 자체가 아니다. 그것은 루프다. 프런티어 모델이 프런티어 모델 운영 비용을 의미 있게 낮출 수 있다면, 가격 곡선은 다음 칩 세대를 기다리지 않고도 스스로 더 가팔라진다. 이는 2026년에 발표된 7,000억 달러 규모 인프라 투자 계획이 말해온 이야기와는 다른 경제적 서사다.

Luna는 더 저렴해졌지만, 최저가는 아니다

80% 인하 이후에도 Luna는 시장 최저가를 밑돌지 않는다. 오픈웨이트 중국 모델인 DeepSeek V4 Flash는 입력 $0.14, 출력 $0.28에 제공된다. Google의 Gemini 2.5 Flash-Lite는 $0.10과 $0.40이다. Luna의 출력 가격은 여전히 DeepSeek의 4배를 넘으며, 에이전트 워크로드에서 비용이 가장 많이 드는 지점도 출력이다.

Terra의 새 가격인 $2와 $12는 정확히 Gemini 3.1 Pro의 공개 요율과 일치하는데, 우연의 일치일 가능성은 낮다. 한편 Anthropic은 Claude Sonnet 5를 8월 31일까지 프로모션 가격인 $2와 $10에 제공하고, 9월 1일부터는 $3와 $15로 되돌린다. 저가 및 중간급 티어는 같은 숫자로 수렴하고 있다. 플래그십 티어는 그렇지 않다.

OpenAI가 공개하지 않은 수치들

서빙 비용 20% 개선은 OpenAI 자체 생산 환경에서 측정한 수치다. 외부 기관의 감사를 거치지 않았고, 회사는 어느 티어에서도 추론의 매출총이익률을 공개하지 않았기 때문에 Luna가 $0.20에 수익성이 있는지, 아니면 더 저렴한 오픈웨이트 경쟁사들에 맞서 점유율을 지키기 위해 그렇게 가격을 책정한 것인지 공개적으로 판단할 방법이 없다.

몇 가지 세부 사항도 이 헤드라인 숫자에 불리하게 작용한다. GPT-5.6의 세 가지 티어 모두 요청이 표준 윈도를 넘어서면 요금이 대략 두 배가 되는 장문맥 미터를 적용한다. 프롬프트 캐시에 새 콘텐츠를 쓰는 비용은 캐시 미적용 입력 가격의 1.25배이며, 반대로 캐시에서 읽을 때는 90% 할인이 적용된다. 그리고 애초에 가격 불만을 불러온 값비싼 수시간짜리 에이전트 실행을 가장 많이 처리할 가능성이 큰 모델인 Sol은 아무런 인하도 받지 못했다.

OpenAI가 보여준 것은 계속 낮아지는 바닥과 움직이지 않는 천장이다. 저렴한 지능은 이제 몇 달이 아니라 몇 주 단위의 일정으로 더 저렴해지고 있다. 프런티어 지능의 가격은 여전히 모델이 써내는 단어 100만 개당 30달러이며, 회사는 방금 그 점을 바꿀 기회를 거절했다.