AI 模型基准测试公司 Artificial Analysis 本周公布了 DeepSeek 最新一代轻量级 V4-Flash 模型的评分,此前该模型已于周五进入公开 测试。出人意料的是,这家中国开发商最便宜的模型在该平台的 Intelligence Index 上获得 50 分,比其旗舰模型 DeepSeek V4 Pro-Preview 高出 6 分。
DeepSeek 的价格也仍显著低于美国领先模型。近几个月,美国竞争对手已采取措施试图缩小这一差距,其中最引人注目的是 OpenAI:该公司在自家平价模型发布仅几天后,就将其成本削减了 80%。无论如何,DeepSeek 的模型输入每百万 token 收费 0.14 美元,输出每百万 token 收费 0.28 美元,仍比 GPT-Luna 便宜 60%。
Flash 如何在智能水平上超越 Pro-Preview
DeepSeek 发布的更新日志显示,Flash 的最新版本与今年 4 月的上一代版本拥有相同的基础架构和规模。
发生变化的是训练后优化。虽然旗舰版 V4-Pro-Preview API 保持不变,但 Flash API 经历了重大改造。结果是“智能体能力显著增强,基准测试结果远超 V4-Pro-Preview”。
智能体能力正日益成为 AI 模型的一项重要基准,反映出模型能力已远远超出基础聊天机器人的范围。它指的是模型处理复杂、多阶段任务的能力,例如编写和测试代码。
AI 基准测试公司 Artificial Analysis 证实了 DeepSeek 关于其最新模型的发现。在独立测试中,Flash 在 Terminal-Bench 2.1 上比前代产品高出 17 分。Terminal-Bench 2.1 用于衡量模型操作命令行的能力。
在 GDPval-AA v2(Artificial Analysis 针对金融、工程和医疗等行业实际工作任务进行的测试)中,该模型的评分从 1,189 提升至 1,559。
这些发现表明,V4-Flash 的智能体能力确实实现了重大提升。
DeepSeek V4-Flash 仍有哪些不足
尽管 DeepSeek 的模型取得了明显进步,但它距离市场领先水平仍相去甚远。Anthropic 的 Claude Opus 4.8 在 DeepSeek 自行发布的每项基准测试中仍处于领先,而同为中国开发商的 Moonshot 则凭借 Kimi K3 模型继续在开放权重模型中领先。
Artificial Analysis 的报告还警告称,V4-Flash 在非正确回答中的幻觉率也很高,达到 84%。这意味着,在无法给出正确回答的情况下,V4-Flash 通常倾向于给出错误答案,而不是拒绝回答。该基准测试公司指出,最新版本编造“最佳猜测”答案的比例低于此前版本,但这一比例仍然很高。
模型冗长也是另一个潜在缺点。据报道,在测试期间,它在整个 Intelligence Index 测试系列中生成了约 2.06 亿个输出 token。这一数字超过中位数的两倍,意味着模型的实际使用成本可能高于其标价所显示的水平。
