总部位于旧金山的 AI 算力和训练工具提供商 Prime Intellect 于周三发布了其开源 Prime Agent 测试框架。该公司自报的基准测试得分表明,这一框架可以显著增强领先 AI 模型的能力。
ARC-AGI-3 是一项由 管理的测试,其管理方为 ARC Prize Foundation。该测试会让 AI 模型进入一系列二维游戏,但不会事先告知完成游戏的方法。模型需要通过反复试错来发现每款游戏的规则,然后完成游戏。目前这项测试中官方验证的最高得分为 30.2%,由 Anthropic 的 Claude Opus 5 保持。
然而,在其自定义测试框架中运行 Claude Opus 5 时,Prime Intellect 报告称得分达到 95.5%——甚至比人类专家基准分高出 0.1%。
需要强调的是,这些数字尚未经过独立验证。ARC Prize 为自报结果单独维护了一个排行榜,这些结果依赖于模型本身之外的自定义软件。
Prime Intellect 的测试框架有何不同
据该公司介绍,区别在于测试框架:也就是管理其中运行的 AI 模型的记忆和工具集的封装层。Prime Intellect 的 95.5% 得分是使用其自定义测试框架,而非 ARC Prize 官方评测设置得出的,这意味着它无法与经过验证的排行榜结果直接比较。
据报道,Prime Intellect 自有的测试框架允许模型动态重写自身指令——提示词、记忆和辅助代理角色——从而比那些“迫使模型绕过自身脚手架,而不是利用脚手架”的测试框架更具优势。OpenAI 的一份报告声称,ARC Prize 的标准测试框架迫使其模型在任务中途覆盖自身记忆,阻碍了模型进展并损害了得分。
相较之下,Prime Intellect 的测试框架通过一个贯穿整个任务始终的实时 Python 会话运行。会话历史可通过程序搜索,这意味着与要求模型重新阅读自身输出的同类测试框架相比,它使用的 token 更少。“refine”命令允许模型即时编辑自己的操作手册。
Prime Agent 在 ARC-AGI-3 之外的其他测试结果
Prime Intellect 让其测试框架参与了广泛的测试。其中一项测试要求它使用 Rust 编程语言从零开始创建复古游戏机模拟器。另一项测试要求它游玩热门的制造业管理游戏 Factorio;在短短几小时内,它便取得了六位数的生产得分。
在游戏过程中,Prime Intellect 报告称,在 Prime Agent 中运行的一个未具名模型发现,它可以利用控制台命令,直接向自己的机器中生成资源。随后,测试框架的 refine 功能将这些成功的漏洞利用转化为可重复使用的技能。尽管系统会定期自动提醒它不要作弊,但它随后仍反复采用这一成功策略。
总体而言,这些结果是最新的数据点,进一步表明 AI 模型的封装层如今与模型本身同等重要。
尽管 Prime Agent 测试框架本身免费,并以 MIT License 发布,但其背后的公司目前估值已达 10 亿美元。TechCrunch 的一份报告详细介绍了该公司 1.3 亿美元的 A 轮融资,以及 1 亿美元的年度化营收运行率。
