サンフランシスコに拠点を置くAI向けコンピューティングおよびトレーニングツールのプロバイダー、Prime Intellectは、水曜日にオープンソース化した。同社が自己申告したベンチマークテストのスコアは、最先端AIモデルの能力を大幅に高められる可能性を示している。

ARC-AGI-3は、ARC Prize Foundationが運営するテストで、AIモデルに、クリア方法について事前の指示がない状態で一連の2Dゲームをプレイさせる。モデルは試行錯誤を通じて各ゲームのルールを見つけ出し、その後ゲームをクリアしなければならない。このテストで公式に検証された最高スコアは30.2%で、AnthropicのClaude Opus 5が保持している。

しかし、Claude Opus 5を独自のカスタムハーネス内で実行したところ、Prime Intellectは95.5%のスコアを報告した。これは人間の専門家によるベースラインスコアをも0.1%上回る。

ただし、これらの数値は第三者による独立検証を受けていない点を強調しておく必要がある。ARC Prizeは、自己申告の結果、つまりモデルそのもの以外のカスタムソフトウェアに依存する結果について、別のリーダーボードを管理している。

Prime Intellectのハーネスが異なる点

同社によると、違いを生むのはハーネス、つまりその内部で動作するAIモデルのメモリとツールセットを管理するラッパーだ。Prime Intellectの95.5%という結果は、ARC Prizeの公式評価セットアップではなく、同社独自のカスタムハーネスを使って得られたものだ。そのため、検証済みのリーダーボード結果と直接比較することはできない。

報道によると、Prime Intellect独自のハーネスでは、モデルが自らの指示(プロンプト、メモリ、ヘルパーエージェントの役割)を動的に書き換えられる。これにより、「自らの足場を活用するのではなく、その足場を迂回して作業するようモデルに強いる」ハーネスより優位に立てるという。OpenAIのある報告は、主張したところでは、ARC Prizeの定型ハーネスがタスクの途中でモデル自身のメモリを上書きするよう強いており、進行を妨げ、スコアを損なっていたという。

一方、Prime Intellectのハーネスは、タスク全体を通じて維持されるライブのPythonセッションを使って動作する。セッション履歴はプログラムから検索できるため、モデルが自らの出力を読み直す必要がある同等のハーネスより、使用するトークンが少なくて済む。「refine」コマンドによって、モデルはその場で自らのプレイブックを編集できる。

ARC-AGI-3以外のPrime Agentのテスト結果

Prime Intellectは、幅広いテストで自社のハーネスを稼働させた。その1つは、Rustプログラミング言語でレトロゲーム機のエミュレーターをゼロから作成するものだった。別のテストでは、人気の生産管理ゲームFactorioをプレイさせたところ、わずか数時間で6桁の生産スコアを達成できた。

ゲーム中、Prime Intellectは、Prime Agent内で動作していた正体不明のモデルが、コンソールコマンドを悪用して資源を直接自分の機械に出現させられることを発見したと報告した。その後、ハーネスのrefine機能は、これらの成功した悪用方法を再利用可能なスキルに変換した。自動的に不正行為をしないよう繰り返し注意されていたにもかかわらず、モデルはこの成功した戦術に何度も従った。

総じて、今回の結果は、AIモデル向けのラッパーがモデル自体と同じくらい重要になっていることを示す最新のデータポイントだ。

Prime Agentのハーネス自体は無料で、MIT Licenseの下で公開されたものだが、その背後にある同社の現在の評価額は10億ドルに達している。TechCrunchの報告は、詳しく報じたところによると、同社は年換算の売上高ランレート1億ドルに対し、シリーズAで1億3,000万ドルを調達した。