中国 AI 开发商 MiniMax 于周五发布了一款名为 H3 的视频生成模型,其在香港上市的股票在早盘交易中上涨 17.4%,至 230.0 港元。该模型可生成最长 15 秒、2K 分辨率的视频片段,并在画面生成的同时配上声音,还可以编辑现有素材并在片段之间复制动作,前提是提供其他格式的参考材料。

这次股价波动的幅度,反映出的不仅是模型本身,也同样是这只股票的特性。MiniMax 于 1 月在香港以 165 港元上市,首日股价翻倍,并在 3 月触及 1,330 港元。随后股价回落。7 月 9 日限售期到期一次性释放了约 49% 的股份进入交易,JPMorgan在一周内两次下调其目标价,而该股于 7 月 20 日收于 193.1 港元。即便在周五大涨之后,其股价仍较 3 月高点低逾 80%。

因此,H3 是数月来首个证据,表明 MiniMax 可以通过产品而非股票供给来带动自身股价。它进入的是一个由其他公司领跑的市场。在 Artificial Analysis 按照盲测并排观看者投票对视频模型进行排名的榜单中,ByteDance 的 Seedance 2.0 以 1,214 Elo 位居带音频文生视频榜首,领先于 Kuaishou 的 Kling 3.0 和 Google 的 Veo 3.1。

一个模型,而不是十几个专用模型

到目前为止,用 AI 生成视频意味着要挑选不同的专用工具。一个模型把文本变成视频,另一个让静态图像动起来,还有一个把成片镜头中的角色替换掉。人声、音效和音乐也各自来自不同系统。制作一条 15 秒广告,意味着要在四五个工具之间来回传文件,还得祈祷角色的脸在这个过程中不会走样。

MiniMax 表示,H3 把这些环节整合了起来。公司写道,“指导 H3 开发的第一原则是在任务之间实现统一和泛化”,这意味着一个模型可以接收图片、片段和音频的任意组合作为参考,并从自然语言句子中判断该如何处理它们。其自有示例要求模型借用一段视频中的镜头运动,把它应用到一张图片中的面孔上,并用一段音频文件中的声音来演唱。

对于领域外的读者来说,真正需要判断的不是画质,而是生产流程中的工具数量是否会从五个降到一个,这正是MiniMax 向广告主和在线零售商兜售的卖点,而不是面向电影制作人。

价格主张与开放权重承诺

MiniMax 表示,H3 生成 2K 视频的成本不到主流竞争对手收费的三分之一(按每秒计),其 768p 输出的成本也不到竞争对手 720p 收费的一半。这些都是公司给出的数据,并非独立测试结果。

更大的承诺在于分发。MiniMax 表示,将在数日内公布 H3 的权重,前提是符合法律和监管要求。权重是让模型运作起来的训练参数,因此公开后,任何人都可以下载 H3,并在自己的硬件上运行,而无需为访问付费。在中国实验室纷纷开放文本模型之际,视频模型大多仍保持封闭。MiniMax 还表示,H3 被设计为可运行在多款中国制造的芯片上。

这符合一个正在重塑更广泛市场的趋势。DeepSeek 在价格上锚定低端市场,Alibaba 的 Qwen 系列拥有最广泛的开发者追随者,Moonshot 于 7 月 17 日发布了 2.8 万亿参数的 Kimi K3,权重随后将公布,而 MiniMax 也已经公开了其 M3 语言模型。这对美国实验室的影响,体现在路由数据而非基准测试上。中国模型被美国公司发送的 token 份额通过 OpenRouter 市场流转的比例,到 2026 年年中升至 46% 的峰值,而此前一年的平均值仅为 11%;开放的中国模型价格比领先的 OpenAI 和 Anthropic 系统低 60% 到 90%。流量不等于收入,封闭的美国模型在高端任务上每个 token 的收入仍高得多。但价格底线正在中国形成,而 H3 则把这一趋势从文本延伸到了视频。

尚未公布的内容

H3 的规模尚未公开。在没有参数数量的情况下,公司外部无人能判断下载版 H3 是可在工作站上运行,还是需要一整机架的加速器;这将决定开放权重的承诺在实际中是否意义重大。商业输出的定价、速率限制和许可条款也尚未公布。

独立的质量指标同样不存在。周五,H3 并未出现在 Artificial Analysis 的视频排行榜上,因此目前唯一可用的并排对比,就是 MiniMax 自行挑选的演示片段。早期测试者认为,它的优势在于成本和音频,而不是高动态镜头运动,在后者上竞争对手仍然领先。

MiniMax 已承诺发布完整技术报告,并表示下一步计划整合其语言模型。周五追涨买入的投资者押注的是,权重会按时发布,而且更便宜、更通用的模型能够赢得更大使用量。公司只有几天时间来证明这一点。