DeepSeek 于周五将其 V4-Flash 模型的正式版推向公开测试,而独立测试很快证实了一件不同寻常的事:这家中国实验室这款小型、低价模型如今跑分超过了自家旗舰。基准测试公司 Artificial Analysis 给这次更新版——标记为 DeepSeek-V4-Flash-0731——在其 Intelligence Index 上打出 50 分,较 2026 年 4 月发布的版本跃升 10 分,也比体量更大、价格高得多的 DeepSeek V4 Pro 领先 6 分。
这一发布时间点让竞争更趋白热化。该版本发布的前一天,OpenAI将 GPT-5.6 Luna 的价格下调,在注重成本的客户压力下,将其低价前沿模型降价 80%。即便在那次降价之后,Artificial Analysis 估计,这款新的 DeepSeek 模型在智能水平上也仅比 Luna 低 1 分,而在 DeepSeek 自家的 API 上,每项任务成本大约低 60%。
低价档反超旗舰
当 DeepSeek 在 4 月推出其 V4 产品线时,它遵循了行业标准的双层逻辑:Pro 是一款 1.6T 参数模型,主打最高能力;Flash 则主打速度和低成本。三个月后,这一等级关系已经倒转,至少暂时如此。V4 Pro API 和 DeepSeek 消费者应用背后的模型都没有变化;只有 Flash API 获得了升级。
该公司对变化内容的表述也很直接。其更新日志写道,该版本“显著增强了智能体能力,基准测试结果远超 V4-Pro-Preview”。智能体任务是指模型能够独立完成的多步骤工作,例如操作终端、编辑代码和调用其他软件,而不是回答单个问题。这正是当前行业认为最有商业价值的类别,因此一款低价模型在这方面击败旗舰预览版,就不只是排行榜上的新鲜事了。
同样引人注目的是,没变的部分。该模型保留了与 4 月版本完全相同的架构和规模:总计 284B 参数,即存储模型所知内容的内部设置,但在任意给定词元上仅激活其中 13B,这有助于保持较低运行成本。DeepSeek 表示,这些提升完全来自后训练,即在模型核心知识构建完成后进行的精修阶段。定价维持不变:每 1M 输入 tokens 收费 $0.14,每 1M 输出 tokens 收费 $0.28;对于缓存输入——也就是系统已处理过的文本——DeepSeek 提供 98% 的折扣,而大多数竞争对手仅提供 90%。
独立数据支持了其 agent 能力方面的说法。在 GDPval-AA v2——Artificial Analysis 对真实工作任务的测试中,该模型评分从 1189 升至 1559;而在衡量模型命令行操作能力的 Terminal-Bench 2.1 测试中,该模型上升 17 个百分点至 79%,这是该公司测试得出的结果。
但这一分数并未解决所有问题
该模型仍然以较高比例编造答案。在 Artificial Analysis 的知识测试中,当它不知道某件事时,有 84% 的概率会捏造一个回答。这比前代好了 12 个百分点,但全部改进都来自它更常选择不猜;它真正答对的问题占比并没有变化。
它也相当冗长。该模型为了完成 Intelligence Index,大约生成了 206M 个输出 tokens,比 4 月版本少 12%,但仍大约是同类模型中位数的两倍。在长时间的 agent 循环中,这意味着实际账单会明显高于其极低的每 token 定价所暗示的水平。
而且天花板仍未触及。Anthropic 的 Claude Opus 4.8 在 DeepSeek 自己公布的每一项基准测试中仍然领先;而在开放模型中,Kimi K3 在该指数上仍领先 7 分。该模型仅处理文本,不支持图像;其 weights——也就是让任何人都能自行运行它的文件——虽已在预期之中,但尚未发布,因此目前它仍只以付费 API 的形式存在。
DeepSeek 表示,V4-Pro 的正式版“将很快推出”。如果仅靠一次后训练就让这款小模型提升了 10 分,那么一个悬而未决的问题是:同样的处理作用于一款规模接近其 6 倍的模型,会带来什么效果。本周,接近前沿水平的智能价格已经两度下跌。其中只有一次需要真的去改价目表。
