최전선 AI 모델이 수학자들이 이미 갖고 있지 않던 수학을 만들어낼 수 있는지, 아니면 매우 빠른 문헌 검색에 불과한지가 올여름 내내 논쟁거리였다. 월요일 Anthropic은 Claude의 수학적 역량에 관한 연구 노트를 발표하며, 아직 공개되지 않은 연구용 버전의 이 모델이 리만 가설과 관련된 오랜 결과를 개선해 입증된 하한을 41.6%에서 67.2%로 끌어올렸다고 밝혔다.

1859년에 제기됐고 7개의 Clay Mathematics Institute 상금 100만 달러 문제 가운데 하나인 리만 가설은 소수 간격을 지배하는 함수의 영점들이 모두 하나의 수직선 위에 놓인다고 본다. 아직 누구도 모든 영점에 대해 이를 증명하지 못했기 때문에, 수학자들은 그중 일부 비율에 대해 이를 증명하는 데 만족한다. 수십 년에 걸친 점진적 연구로 그 비율은 41.6%까지 올라왔다. 이 새로운 수치는 증명을 향한 진행 막대가 아니며, Anthropic도 같은 노트에서 Claude의 기법이 그런 증명을 만들어낼 것으로 기대하지 않는다고 밝혔다.

투자자들에게 더 중요한 세부 사항은 어떤 모델이 이를 해냈느냐다. Anthropic은 해당 체크포인트의 이름을 밝히지 않았고, 가중치를 공개하지도 않았으며, 시스템도 이용 가능하게 하지 않았다. OpenAI도 8월 1일 같은 일을 했는데, 그날 수학과 이론 컴퓨터 과학의 미해결 문제 10개에 대한 해답을 발표하고 그 공을 Astra의 내부 버전에 돌렸다. Astra는 출시일이나 가격이 없는 모델이다. 이제 두 연구소 모두 외부에서는 아무도 시험할 수 없는 시스템에 가장 강력한 역량 주장을 기대고 있다.

이 노트는 Anthropic의 이전 수학적 결과가 나온 지 3주 만에 발표되기도 했다. 7월에 회사의 수론학자인 Levent Alpöge는 Claude Fable 5와 함께 찾아낸 반례를 게시했는데, 이는 87년 된 야코비안 추측이 3차원 이상에서 성립한다는 주장을 반박한 것이었고, Terence Tao는 그 다음 날 그 반례를 공개적으로 검토했다. Alpöge는 이후 제타 함수 결과를 검증한 Anthropic 소속 수학자 2명 중 한 명이다.

수학자가 아닌 사람이 세션을 운영했다

이 설명에서 가장 주목받는 부분은 누가 키보드 앞에 있었느냐다. 이를 실행한 직원 Jarred Sumner는 수학자가 아니며, Anthropic은 그가 수학적 선택은 모델에 맡겼다고 말한다. 지금까지 이런 종류의 결과는 전문가 수준의 프롬프트로 모델을 이끄는 수학자들로부터 나왔다. Anthropic은 결정적인 실행 동안 Sumner의 입력이 "대체로 Claude에게 격려의 메시지를 보내는 데 제한됐다"고 썼으며, 대부분은 "계속해" 또는 "스스로를 믿어" 같은 표현의 변형이었다고 한다. 회사는 그것이 모델이 스스로도 초기에 품었던, 뭔가 성과를 낼 수 있을지에 대한 회의감을 넘기는 데 도움이 된 것으로 보인다고 밝혔다.

계산은 그보다 덜 섬세했다. Claude는 첫 번째 시도에서 650개의 아이디어를 시험했지만 어느 것도 통하지 않았다. 다시 해보라는 지시를 받은 뒤, 약 하루 반 동안 자신과 비슷한 복사본 약 60개를 조율했는데, Anthropic은 이를 하위 에이전트라고 부른다. 이들은 합쳐 2,400개의 셸 명령을 실행하고 수백 개의 파이썬 스크립트를 작성해 후보 논증을 알려진 영점들과 대조해 시험했다. 60개 중 2개가 핵심 아이디어를 만들어냈고, 30개는 쓸 만한 결과를 내지 못했으며, 두 세션은 AI 연구소들이 과금 단위로 사용하는 3,100만 출력 토큰을 소모했다.

그런 다음 Claude는 자신의 결과를 스스로 공격해, 하위 에이전트들이 반례를 찾고 arXiv에서 논문 54편을 가져와 해당 발견이 새로운 것임을 확인하게 했으며, 처음부터 다시 유도하도록 했다. 또한 이 작업을 논문으로 정리할 것을 제안했고 인간 수론학자의 검토를 권고했다.

이 결과는 동료 심사를 거치지 않았다

Alpöge와 Ralph Furman은 Anthropic 내부에서 이 논문을 검증했다. 수론의 이 분야 전문가 두 명인 Brian Conrey와 Dan Goldston도 회사 요청으로 촉박한 일정 속에 이를 읽었다. Conrey는 1989년에 바로 이 같은 하한에서 40% 기준을 세운 인물이다. 촉박한 일정 속 전문가의 검토는 학술지 심사와는 다르며, 학술지 심사는 뉴스 사이클이 아니라 수개월 단위로 돌아간다.

Claude는 또한 컴퓨터가 검증할 수 있는 버전의 증명도 만들어냈는데, Lean 증명 보조기에서 작성됐고 공개 저장소로 게시됐다. 이는 유명한 문제의 증명이라고 주장되는 것들을 대부분 무너뜨리는, 눈에 띄지 않는 논리적 공백을 배제한다. 하지만 형식화된 진술이 수론학자들이 중요하게 여기는 바로 그 진술이라는 점까지 확립해주지는 않으며, 그것을 생성한 모델에 대해서도 아무것도 말해주지 않는다.

빠진 수치가 하나 있다. Anthropic은 3,100만 출력 토큰은 공개했지만 달러 기준 비용은 밝히지 않았고, 모델이 아직 공개되지 않았기 때문에 곱해볼 수 있는 공개 요금도 없다. OpenAI는 자사의 10개 증명에 들어간 토큰 비용을 대략 2,000달러로 추산했다. 이런 종류의 연구가 산업 규모로 돌릴 만큼 충분히 저렴한지 판단하려는 사람에게는 그 숫자에 해당하는 Anthropic의 버전이 필요하다.

그때까지 검증 가능한 주장은 좁은 범위에 머문다. 계속하라는 말을 들어야 했던 한 모델이 Conrey의 결과 이후 37년 동안 인간 수학자들이 1.6%포인트 끌어올린 하한을 움직였다는 것이다.