DeepSeek 周五发布了一款实验性视觉模型,这家中国 AI 初创公司称,该模型使其多模态智能体在基准测试中的表现接近 Anthropic 的 Opus-4.8。

该模型 DeepSeek-V4-Flash-Vision-Exp 现已通过 DeepSeek API Platform 提供,该公司在一则公告中表示。该公司补充称,该模型在文本能力方面与 V4 Flash 持平,包括智能体、推理和世界知识,同时新增了图像输入。

该公司表示,新模型在多模态智能体基准测试上相较 V4 Flash 实现了“重大飞跃”,使其表现接近 Opus-4.8。DeepSeek 未在公告中提供基准测试分数。

值得注意的是,该模型可以结合文本分析图像,包括描述图片、读取截图中的文字以及分析图表。它支持 JPEG、PNG、GIF 和 WebP 图像。

DeepSeek 表示,V4 Flash Vision 支持 Chat Completions、Messages 和 Responses API。图像可通过 base64 数据、外部 URL 或其新推出的 Files API 传入。

图像会被标记化用于计费,每张图像按 V4 Flash 的定价最多消耗 384 个令牌。该模型在单次请求中最多可处理 600 张图像,而单张图像通过 base64 或外部 URL 传入时最大可达 32 兆字节,通过 Files API 引用时可达 64 兆字节。

Files API 允许用户上传一次图像,并在多个请求中通过文件 ID 进行引用。DeepSeek 表示,该服务可免费使用,并且在重复使用同一图像时还可减少带宽消耗。

此次发布正值 DeepSeek 已重启其第二轮融资,寻求接近 80 亿美元的融资,Monolith Management 正洽谈参与其中,彭博社本月早些时候报道称。该公司寻求接近 5000 亿元人民币(743 亿美元)的估值。