샌프란시스코에 기반을 둔 AI 컴퓨팅 및 학습 도구 제공업체 Prime Intellect가 출시했다 수요일 오픈소스 Prime Agent 하니스를 공개했다. 회사가 자체 보고한 벤치마크 테스트 점수에 따르면 이 하니스는 주요 AI 모델의 역량을 크게 향상할 수 있다.
ARC-AGI-3는 ARC Prize Foundation이 관리하는 테스트로, AI 모델에 게임을 완료하는 방법에 대한 사전 지시 없이 일련의 2D 게임을 수행하게 한다. 이후 모델은 시행착오를 통해 각 게임의 규칙을 발견하고 게임을 완료해야 한다. 이 테스트에서 공식적으로 검증된 최고 점수는 30.2%이며, Anthropic의 Claude Opus 5가 보유하고 있다.
그러나 Prime Intellect는 Claude Opus 5를 자체 맞춤형 하니스에서 실행했을 때 95.5%의 점수를 기록했다고 보고했다. 이는 인간 전문가 기준 점수보다도 0.1% 높은 수치다.
다만 이 수치는 독립적으로 검증되지 않았다는 점을 강조할 필요가 있다. ARC Prize는 자체 보고 결과, 즉 모델 자체를 넘어서는 맞춤형 소프트웨어에 의존하는 결과를 위한 별도의 순위표를 운영한다.
Prime Intellect의 하니스가 다른 점
회사에 따르면 차이를 만드는 것은 하니스, 즉 그 안에서 작동하는 AI 모델의 메모리와 도구 세트를 관리하는 래퍼다. Prime Intellect의 95.5% 결과는 ARC Prize의 공식 평가 설정이 아닌 자체 맞춤형 하니스를 사용해 도출됐으므로, 검증된 순위표 결과와 직접 비교할 수 없다.
Prime Intellect의 자체 하니스는 모델이 자체 지침, 즉 프롬프트와 메모리, 보조 에이전트 역할을 동적으로 다시 작성할 수 있도록 하는 것으로 알려졌다. 이를 통해 "모델이 자체 스캐폴딩을 활용하지 못하고 그 주변에서 작업하도록 강제하는" 하니스보다 유리한 위치를 차지한다. OpenAI의 한 보고서는 주장했다 ARC Prize의 기본 하니스가 작업 도중 모델의 자체 메모리를 덮어쓰도록 강제해 진행을 방해하고 점수를 떨어뜨렸다고.
반면 Prime Intellect의 하니스는 전체 작업 동안 유지되는 실시간 Python 세션을 사용한다. 세션 기록은 프로그래밍 방식으로 검색할 수 있어, 모델이 자체 출력을 다시 읽어야 하는 유사 하니스보다 토큰을 적게 사용한다. 모델이 즉석에서 자체 플레이북을 편집할 수 있도록 하는 부분은 “refine” 명령이다.
ARC-AGI-3를 넘어선 기타 Prime Agent 테스트 결과
Prime Intellect는 광범위한 테스트에 자체 하니스를 적용했다. 한 테스트에서는 Rust 프로그래밍 언어로 레트로 게임 콘솔 에뮬레이터를 처음부터 제작하도록 했다. 또 다른 테스트에서는 인기 제조 경영 게임 Factorio를 플레이하도록 했으며, 불과 몇 시간 만에 6자리 수의 생산 점수를 달성할 수 있었다.
게임 도중 Prime Intellect는 Prime Agent 내부에서 실행되던 정체불명의 모델이 콘솔 명령어를 악용해 자원을 기계에 직접 생성할 수 있다는 사실을 발견했다고 보고했다. 이후 하니스의 refine 기능은 이러한 성공적인 악용 방법을 재사용 가능한 기술로 전환했다. 모델은 부정행위를 하지 말라는 자동 알림이 반복적으로 전달됐음에도 이 성공적인 전술을 계속 우선시했다.
종합하면 이번 결과는 AI 모델을 위한 래퍼가 이제 모델 자체만큼이나 중요해졌다는 점을 보여주는 최신 데이터 포인트다.
Prime Agent 하니스 자체는 무료이며 MIT License로 공개됐지만, 이를 개발한 회사의 기업 가치는 현재 10억 달러에 달한다. TechCrunch의 한 보고서는 상세히 전했다 회사가 연환산 매출 런레이트 1억 달러를 기록한 가운데 1억3,000만 달러 규모의 Series A 투자를 유치했다고.
