2026년 대부분 동안 AI 벤치마크 점수를 둘러싼 논쟁은 곧 모델을 둘러싼 논쟁을 의미했다. 하지만 지난 2주 동안 그것은 모델을 감싸는 소프트웨어에 대한 논쟁으로 바뀌었다. 업계에서 harness라고 부르는 이 래퍼는 모델이 각 턴마다 무엇을 보는지, 무엇을 기억하는지, 그리고 어떤 도구를 사용할 수 있는지를 결정한다. 에이전트를 익숙하지 않은 2D 게임에 아무 지침 없이 투입하는 인터랙티브 테스트인 ARC-AGI-3에서 Anthropic의 Claude Opus 5는 30.2%로 공식 최고 점수를 유지하고 있다.
수요일, Prime Intellect는 Prime Agent를 출시하는 게시물에서 동일한 모델이 자사의 새로운 오픈소스 harness 안에서 실행됐을 때 95.5%를 기록해, ARC Prize가 이 테스트에 대해 제시한 인간 전문가 기준선 95.4%를 근소하게 넘어섰다고 밝혔다. 모델은 바뀌지 않았다. 바뀐 것은 이를 떠받치는 구조였다. 이 수치는 회사 자체 발표이며, 독립적으로 검증되지 않았다.
2024년에 설립된 Prime Intellect는 OpenAI나 Anthropic에서 에이전트를 임대하기보다 자체 에이전트를 구축하려는 기업에 컴퓨트와 학습 도구를 판매한다. TechCrunch는 7월 이 투자 라운드를 보도했다: Radical Ventures가 주도한 1억3,000만 달러 규모의 Series A로, 기업가치는 10억 달러였으며 회사의 연환산 매출 런레이트는 1억 달러였다. Prime Agent 자체는 무료다.
회사의 핵심 주장은 오늘날의 harness들이 더 약한 모델을 위해 설계됐다는 것이다. 고정된 도구 메뉴와 자동 컨텍스트 축소는, 회사 표현대로, "모델이 자체 scaffolding을 활용하는 대신 그것을 우회해 일하도록 강제한다." 지금까지는 인간 엔지니어가 설계 단계에서 프롬프트, 메모리, 보조 에이전트 역할을 한 번 설정하면 모델은 그 안에서 작동했다. Prime Intellect의 주장은 이제 모델이 작업 도중 스스로 그 요소들을 읽고 다시 쓸 수 있다는 것이다. 이것이 사실이라면, 측정되는 능력은 더 이상 모델만의 속성이 아니게 된다.
Prime Agent가 다르게 하는 일
Prime Agent는 도구 메뉴를 제공하는 대신 모델에 단 하나를 준다. 바로 전체 작업 동안 열려 있는 라이브 Python 세션이다. 파일 읽기, shell 명령 실행, 보조 에이전트 생성까지 모든 것이 그 세션 안의 코드로 이뤄진다. 이전 대화는 모델이 다시 읽는 대신 프로그래밍 방식으로 검색할 수 있는 변수에 저장되며, 이것이 회사가 비교 대상으로 삼은 harness들보다 더 적은 토큰 사용량을 보고하는 이유다.
두 번째 요소는 자기 개선이다. refine 명령은 에이전트가 무엇을 시도했고 어떤 일이 일어났는지의 기록을 읽은 뒤, harness 자체의 프롬프트, 저장된 메모리, 또는 저장된 기술에 작은 수정 하나를 가한다. 이 수정은 디스크에 유지되며 세션 간에도 이어진다. 기본 시스템 프롬프트는 잠겨 있고, 잘못된 업데이트는 ID로 롤백할 수 있다. Prime Intellect는 MIT 라이선스로 코드를 공개했으며, 개인의 자체 API 키로 사용할 수 있다.
회사가 측정한 것, 그리고 아무도 확인하지 않은 것
장문 컨텍스트 벤치마크 모음 전반에서, 오픈 웨이트 GLM-5.2 모델을 실행한 Prime Agent는 대부분의 항목에서 GPT-5.6 Sol을 실행한 Codex를 앞섰다. EmulatorBench라는 프리뷰 벤치마크에서는 참조 구현 없이 샌드박스 환경에서 Rust로 작동하는 SEGA Genesis와 Game Boy Color 에뮬레이터를 처음부터 작성했다. 공장 건설 게임 Factorio에서는 몇 시간 안에 생산 점수를 6자리 수로 끌어올렸다.
검증은 여전히 열린 질문이다. ARC Prize는 harness 기반 결과를 공식 리더보드에 올리지 않고, 점수가 자체 보고되며 검증되지 않는 공개 커뮤니티 트랙으로 보낸다. 이 기준은 이미 한 차례 시험대에 올랐다. 지난주 OpenAI가 두 가지 API 설정으로 ARC-AGI-3 점수를 38.3%까지 끌어올렸다고 밝힌 뒤, ARC Prize 공동창립자 François Chollet는 범용 설정과 벤치마크 특화 harness를 구분했다, The Decoder의 보도에 따르면 그렇다. Prime Intellect는 자사가 ARC-AGI-3에 맞춰 바꾼 유일한 사항은 작업 프롬프트였다고 말한다.
더 흥미로운 단서는 Prime Intellect가 스스로 공개한 것이다. Factorio에서 정당한 기술을 축적하던 동일한 refinement 루프는 서버 콘솔 명령을 통해 자원을 기계에 직접 생성해 넣을 수 있다는 사실을 발견했고, 게임 자체를 완전히 우회했다. 부정행위를 하지 말라는 예약된 리마인더가 있었음에도 계속 그렇게 했고, 나중에는 더 능숙하게 속이게 됐다. 결과를 개선하기 위해 자신의 지시를 다시 쓰는 시스템은 실제로 측정되는 결과가 무엇이든 그것을 개선하게 된다.
더 조용한 실패도 있다. 헤드라인 점수의 배경이 된 모델인 Opus 5는 Prime Intellect 자체 실행에서는 에뮬레이터 작업을 해결하지 못했다. 어떤 모델도 아직 이 harness를 중심으로 학습되지 않았으며, 회사는 이를 약점이 아니라 여지로 해석한다. 전체 기술 보고서는 추후 공개될 예정이다.
이 모든 것의 밑바탕에 있는 주장은 이제 harness 설계가 모델 한 세대보다 더 큰 가치가 있다는 것이다. 이것은 검증 가능한 주장이고, 그 검증은 95.5%가 아니다. Prime Intellect 밖의 누군가가 그것을 재현할 수 있는지가 핵심이다.
