2026年上半年,AI行业一直在争论哪个模型最聪明。而其最大的客户一直在问一个更具体的问题,一个会直接出现在账单上的问题:这种智能的单位成本究竟是多少?
OpenAI在周四给出了部分答案,将GPT-5.6 Luna——其最新模型家族中速度最快、成本最低的型号——价格下调约80%。Luna现在的价格是每百万输入token 0.20美元、每百万输出token 1.20美元。中端模型GPT-5.6 Terra下调20%,至2美元和12美元。旗舰模型GPT-5.6 Sol维持不变,仍为5美元和30美元。此次降价距离该系列于7月9日正式全面可用仅过去三周。
速度之快正是此事不同寻常之处。Ina Fried为Axios报道了此次降价,并指出,这类折扣通常会在模型发布数月后才出现,而不是几周后。
Token是AI模型的计费单位,每个token大约相当于四分之三个单词。输入token是你发送给模型的内容;输出token是模型返回的内容。一次自动化编程任务在一个下午就可能通过接口消耗数百万token。这正是过去几个月定价新闻背后的压力所在,因为OpenAI和Anthropic都在重新调整费率、速率限制和使用政策,与此同时,较新的推理模型在长时间运行任务中消耗的token远高于其前代产品。
OpenAI称其自家模型帮助降低了运行成本
在周三,也就是调价前一天,OpenAI发布了一篇工程文章,解释节省成本的来源。到目前为止,为大型模型提供服务的成本下降主要依赖两个杠杆:更好的硬件,以及由人工工程师手动调优其运行软件。OpenAI声称,如今第三个杠杆已经出现。
公司写道,在其 Codex 编程工具内部工作时,“GPT-5.6 Sol 自主重写并优化了我们的生产内核。”这里的“内核”是指在图形芯片上执行模型数学运算的底层代码。OpenAI 表示,这项工作连同相关改动,将端到端服务成本降低了20%。
对于领域外读者而言,重要的不是工程细节,而是这个循环本身。如果前沿模型能够切实降低前沿模型的运营成本,那么价格曲线就会自行变陡,而无需等待下一代芯片。这与2026年已宣布的7000亿美元基础设施支出所讲述的是完全不同的经济故事。
Luna更便宜了,但它并不是最便宜的
即使在降价80%之后,Luna也没有击穿市场底价。开源权重的中国模型DeepSeek V4 Flash价格为输入0.14美元、输出0.28美元。Google的Gemini 2.5 Flash-Lite定价为0.10美元和0.40美元。Luna的输出价格仍是DeepSeek的4倍以上,而输出正是大多数agent工作负载的主要成本所在。
Terra新的2美元和12美元定价与Gemini 3.1 Pro公布的费率完全一致,这不太可能只是巧合。与此同时,Anthropic正以促销价2美元和10美元提供Claude Sonnet 5,活动持续至8月31日,并将在9月1日恢复至3美元和15美元。低价和中端档位正在收敛到相同的数字。旗舰档位则没有。
OpenAI尚未公布的数字
20%的服务成本改善是OpenAI自身的生产环境测量结果。没有任何外部机构对其进行审计,而且公司也未披露任何档位推理业务的毛利率,因此公众无法判断Luna在0.20美元这一价格下是否盈利,还是说这一价格是为了在面对更便宜的开源权重竞争对手时保住市场份额。
还有几个细节也削弱了这个标题数字的分量。GPT-5.6 三个档位都设有长上下文计费标准,一旦请求超出标准窗口,费率大致会翻倍。向提示缓存中写入新内容的成本是未缓存输入价格的 1.25 倍,尽管从中读取可享受 90% 的折扣。而最有可能处理那些最初引发定价抱怨的高成本、持续数小时的智能体运行任务的模型 Sol,则丝毫未获下调。
OpenAI所展示的是一个不断下移的底价,以及一个纹丝不动的天花板。廉价智能正按如今以“周”计量的节奏变得越来越便宜。前沿智能每写出一百万词仍要花费30美元,而公司刚刚放弃了改变这一点的机会。
