DeepSeek 于周四发布了 V4.1-Flash 模型,推出了一种拥有 552B 参数的混合专家架构,其中输入处理启用 8B 参数,输出处理启用 16B 参数。

据一份声明称,该模型采用全新的因果编码器-解码器架构,并支持原生多模态输入,包括视觉理解。DeepSeek 表示,V4.1-Flash 是其新架构系列中规模最小的模型。

该公司指出,一个关键变化是模型缩减了 KV 缓存占用,并补充称,V4.1-Flash 所需的 HBM 仅为上一代的四分之一,SSD 存储空间仅为八分之一。

据该公司介绍,更小的缓存降低了智能体工作负载的存储需求;在这类工作负载中,缓存命中成本可能占总体使用成本的很大一部分。

V4.1-Flash 现已通过 DeepSeek 的 API 提供,而旧版 V4-Flash 和 V4-Flash-Vision-Exp 模型已停止提供。为确保兼容性,使用它们 API 名称的请求将暂时被路由至 V4.1-Flash。

值得注意的是,在多方测试中,V4.1-Flash 在性能、成本、速度和总运行时间方面均超过了 V4-Pro,因此该公司正逐步淘汰后者。

从下周 9 月 14 日 04:00 UTC 开始,DeepSeek 将把所有发往 V4 Pro 的请求路由至 V4.1-Flash,并按照最新模型的费率计费。根据声明,这一安排将持续到 DeepSeek 发布 V4.1-Pro 为止。

该公司已调整 V4.1-Flash API 的定价,非高峰时段费率为高峰价格的一半。新定价已于 9 月 10 日 04:00 UTC 生效。腾讯的 WorkBuddy 和 CodeBuddy,以及 OpenCode,现已支持该模型。