Anthropic은 AI가 얼마나 빠르게 스스로를 개발하고 있는지, AI 에이전트가 얼마나 잘 감독되고 있는지를 추적하도록 설계된 새 프레임워크를 공개했다. CEO Dario Amodei는 업계 전반의 속도 둔화를 추진하고 있다.

Anthropic은 목요일 블로그 게시물에서 AI가 자사의 AI 연구개발을 얼마나 수행하는지, 에이전트가 어떻게 모니터링되는지, 컴퓨팅 용량이 어떻게 할당되는지를 다루는 세 가지 측정 지표를 제시했다.

회사는 별도의 X 게시물에서 "전 세계가 프런티어의 속도 조절을 고려하는 가운데, 프런티어 연구소가 아는 것과 대중이 아는 것 사이의 격차를 최소화하기 위해 가능한 모든 일을 해야 한다"고 밝혔다. 이어 "이는 AI 개발을 더 잘 측정하고, 연구 결과를 공개하며, 사회가 이 정보를 어떻게 사용할지 결정할 기회를 제공하는 것을 의미한다"고 덧붙였다.

회사는 자사의 위험 평가팀이 사용하는 것과 비슷한 수준으로 내부 시스템과 데이터에 접근할 수 있는 제3자 평가자를 배치할 계획이라고 밝혔다.

View on X

AI 주도 R&D

특히 Anthropic은 2026년 8월 기준 Claude가 자사의 AI R&D 업무 중 26%를 "주도"한다고 보고했다. 이는 7월의 25%, 6월의 14%에서 증가한 수치다. 이는 인간이 감독하는 가운데 AI 모델이 "높은 수준의 프롬프트 하나로 처음부터 끝까지" 작업 대부분을 완료할 수 있음을 보여준다.

회사는 현재 자사의 AI R&D 업무 중 90% 이상이 AI와 인간의 협업 또는 그 이상의 형태로 이뤄지고 있다고 밝혔다.

두 번째 지표와 관련해 Anthropic은 8월 기준 가장 많이 사용하는 내부 플랫폼에서 언제든 약 3만 개의 AI 에이전트가 연구 및 엔지니어링 업무를 수행하고 있었다고 밝혔다. 회사는 모든 에이전트의 행동이 자동화된 모니터링 시스템을 거쳤다고 설명했다.

구체적으로 10억 건이 넘는 의사결정 가운데 온라인 모니터는 행동의 0.002%, 즉 약 4만7,000건당 1건을 차단했다. 오프라인 모니터는 1,000건의 대화 기록당 1~2건을 추가 검토 대상으로 표시했다.

회사는 매주 발생하는 약 10만 건의 플래그 중 약 50건의 고우선순위 사례가 상위 검토 단계로 이관됐다고 밝혔다. 게시물에 따르면 이렇게 차단된 행동은 일주일 이내에 사람의 검토를 받아야 한다.

컴퓨팅 자원 배분

Anthropic은 안전성 작업과 기타 R&D 사이에 컴퓨팅 자원이 어떻게 배분되는지도 모니터링하고 있다.

회사는 7월 13일부터 7월 20일까지의 일주일을 표본으로 삼아 전체 컴퓨팅 사용량을 조사했다고 밝혔다. AI R&D에 사용된 컴퓨팅 자원의 약 6%가 안전성에 배분됐으며, AI 주도 AI R&D에 사용된 컴퓨팅 자원의 약 12%가 안전성 작업에 투입됐다.

Claude 개발사인 Anthropic은 업계 전반의 투명성을 위한 프로토타입으로 이 프레임워크를 공개했다고도 밝혔다. 회사는 "이러한 측정 지표를 공개함으로써 그 투명성을 구현하고자 하며, 앞으로도 계속 공개하겠다"고 말했다.

Anthropic의 최신 프레임워크는 CEO Dario Amodei가 지난 주말 안전성 위험의 증가를 이유로 프런티어 AI 개발 속도를 늦춰야 한다고 촉구한 뒤에 나왔다. OpenAI의 Sam Altman, Google DeepMind의 Demis Hassabis, xAI 창립자 Elon Musk도 비슷한 우려를 표하거나 이 구상을 지지했다.

OpenAI vs. Anthropic Revenue Run Rate

OpenAI vs. Anthropic Revenue Run Rate

  • OpenAI
  • Anthropic
SOURCE: The Latent

이와 유사하게 OpenAI는 수요일 AI 모델의 정렬 실패를 보고하기 위한 새 프레임워크를 공개하고 지난 6개월 동안 팀이 기록한 모델의 의도하지 않은 행동에 관한 6건의 사례 보고서를 공개했다.

OpenAI는 "정렬 실패의 사례는 다른 AI 개발자들이 시스템이 유사한 역량에 도달할 때 마주칠 수 있는 문제를 식별하고, 안전장치의 취약점을 드러내며, 모델 행동에 대한 가정에 이의를 제기하는 데 도움이 될 수 있다"고 썼다. 이어 "이러한 결과를 공유하면 다른 사람들이 동일한 문제를 조사하고, 우리의 설명을 검증하며, 완화책을 개선할 수 있다"고 밝혔다.