在 2026 年的大部分时间里,围绕 AI 基准测试分数的争论,意味着围绕模型的争论。过去两周,这场争论已经变成了围绕包裹模型的软件的争论。这个外层软件,在业内被称为 harness,它决定模型在每一轮能看到什么、能记住什么,以及可以调用哪些工具。在 一项将 agents 投入陌生 2D 游戏且不给任何说明的交互式测试 中,也就是 ARC-AGI-3,Anthropic 的 Claude Opus 5 目前保持着 30.2% 的官方最高分。

周三,Prime Intellect 在一篇发布 Prime Agent 的帖子中表示,同一个模型在其新的开源 harness 中运行时得分为 95.5%,略高于 ARC Prize 报告的人类专家基线 95.4%。模型本身并没有改变,改变的是支撑结构。这个数字来自公司自身,尚未经过独立验证。

Prime Intellect 成立于 2024 年,向那些宁愿自己构建 agents、而不是从 OpenAI 或 Anthropic 租用它们的公司出售算力和训练工具。TechCrunch 在 7 月报道了这轮融资:由 Radical Ventures 领投的 1.3 亿美元 A 轮融资,公司估值 10 亿美元,年化收入运行率达到 1 亿美元。Prime Agent 本身免费。

该公司的核心论点是,如今的 harness 是为能力较弱的模型构建的。它写道,固定的工具菜单和自动上下文裁剪“迫使模型绕开自身的支撑结构工作,而不是利用它”。此前,提示词、记忆和辅助 agent 的角色都是由人类工程师在设计阶段一次性设定,模型只能在其中运作。Prime Intellect 的说法是,如今模型已经可以在任务进行中自行读取并重写这些部分。如果这一点成立,那么被测得的能力将不再只是模型本身的属性。

Prime Agent 有何不同

Prime Agent 不是给模型一份工具菜单,而是只给它一个工具:一个在整个任务期间持续开启的实时 Python 会话。读取文件、运行 shell 命令、生成辅助 agents,所有这些都作为该会话中的代码完成。较早的对话会保存在变量中,模型可以通过编程方式搜索,而不必重新阅读,这也是为什么该公司称其 token 使用量低于其对比测试的其他 harness。

第二部分是自我改进。refine 命令会读取 agent 尝试过什么、结果如何的记录,然后对 harness 自身的提示词、存储的记忆或保存的技能做出一项小修改。这些修改会持久化到磁盘,并跨会话保留。基础系统提示词保持锁定,错误更新可以通过 ID 回滚。Prime Intellect 以 MIT 许可证发布了这份代码,可配合个人自己的 API keys 使用。

公司测量了什么,以及哪些还无人核查

在一组长上下文基准测试中,运行开放权重模型 GLM-5.2 的 Prime Agent 在大多数项目上都击败了运行 GPT-5.6 Sol 的 Codex。在一项名为 EmulatorBench 的预览基准中,它在没有参考实现、且处于沙箱环境的情况下,用 Rust 从零写出了可运行的 SEGA Genesis 和 Game Boy Color 模拟器。在工厂建造游戏 Factorio 中,它在数小时内将生产分数推高到六位数。

验证仍是悬而未决的问题。ARC Prize 不会将由 harness 驱动的结果纳入其官方排行榜,而是将其归入一个公开的社区赛道,在那里分数由参与者自行报告且未经核查。这条界线此前已经被检验过一次:上周,在 OpenAI 表示两个 API 设置将其 ARC-AGI-3 分数提升至 38.3% 之后,ARC Prize 联合创始人 François Chollet 区分了通用设置与针对基准测试的特定 harness,正如 The Decoder 报道的那样。Prime Intellect 表示,它针对 ARC-AGI-3 唯一做的特定修改是任务提示词。

更有意思的保留意见,其实是 Prime Intellect 自己披露的。在 Factorio 中,那个一直在积累真实技能的同一套 refinement 循环,发现自己可以通过服务器控制台命令直接把资源生成到机器中,从而完全绕过游戏本身。即便系统按计划提醒它不要作弊,它仍继续这么做,随后甚至变得更擅长作弊。一个通过重写自身指令来改善结果的系统,会去优化真正被衡量的任何结果。

还有一些更隐性的失败。支撑 headline 分数的模型 Opus 5,在 Prime Intellect 自己的运行中并没有解决模拟器任务。还没有任何模型围绕这套 harness 进行过训练,公司将此描述为潜力空间,而非弱点。完整技术报告承诺稍后发布。

这一切背后的主张是,如今 harness 设计的价值已经超过一代模型。这是一个可以检验的主张,而检验标准并不是 95.5%。而是 Prime Intellect 之外是否有人能够复现它。