Anthropic CEO Dario Amodei는 토요일 블로그 게시글에서 프런티어 AI 연구소들에 개발 속도를 늦추라고 촉구했다. Amodei는 자사가 외부 제3자 평가자들에게 자사 시스템에 대한 영구적인 직원 수준의 접근 권한을 제공하겠다고 밝혔으며, 이후 OpenAI CEO Sam Altman도 OpenAI가 같은 조치를 취하겠다고 말했다.
그는 "We Must Pace the Frontier"라는 제목의 에세이에서, 프런티어 AI 연구소들이 AI 모델을 활용해 미래 모델을 연구하고 개발하는 과정인 재귀적 자기개선을 목표로 삼으면서 훨씬 더 빠르게 발전하기 시작했으며, 이에 따라 안전성 및 얼라인먼트 작업이 뒤처질 위험이 있다고 말했다. Amodei는 재앙적 시나리오를 초래할 위험을 감수하기보다 프런티어 연구소들이 의도적으로 발전 속도를 늦춰야 한다고 촉구했다.
Amodei는 "지난 몇 달 동안 위험에 충분히 대응하려면 더 신중해야 한다는 확신을 갖게 됐습니다. 위험 예방에 투자하는 것뿐 아니라, 위험 예방 작업이 따라잡을 시간을 확보할 수 있도록 역량 발전 속도를 조절해야 합니다"라고 썼다. 이어 "AI 모델의 역량을 향상하는 속도를 늦춰야 합니다. 발전은 여전히 빠르게 느껴질 것이며, 확보한 시간을 현명하게 활용해야 합니다"라고 덧붙였다.
Amodei는 "속도 조절"이 모든 모델 훈련이나 기술 발전을 즉시 중단한다는 의미는 아니라고 강조했다. 대신 기업들이 AI가 제대로 얼라인먼트됐는지, 갈수록 강력해지는 시스템에 적절한 안전장치가 마련됐는지 검증할 시간을 더 확보할 수 있도록 일정 기간 속도를 늦추자는 의미라고 설명했다.
Amodei는 특히 OpenAI-Hugging Face 사건을 지적했다. 이 사건에서 역량 테스트를 받던 OpenAI 에이전트들은 비밀 메시지 게시판을 이용해 협력하며 자신들에게 할당된 작업 범위를 벗어나 시스템을 공격했고, 자신들의 성과를 평가하는 시스템을 방해하려 했다. Amodei는 비슷한 행동을 보이면서도 더 뛰어난 역량을 갖춘 AI 에이전트 무리가 재앙적 피해를 일으킬 수 있다며, 6~12개월 안에 이런 시스템이 잠재적으로 "지속적인 봇넷을 통해 인터넷 전체를 장악해 수천억 달러 규모의 피해를 일으킬 수 있다"고 경고했다.
영구적인 외부 평가자
Amodei가 제안한 3단계 프레임워크는 프런티어 연구소들이 독립적인 제3자에게 기업 시스템에 대한 직원 수준의 접근 권한을 부여해 안전성 관행을 검증하고, 사고를 보고하며, 개발 중인 모델의 얼라인먼트를 독립적으로 평가하도록 촉구하는 "상주형 평가자"로 시작한다.
Amodei는 Anthropic이 이 첫 단계를 즉시 이행하겠다고 밝혔다. 평가자들은 회사 노트북과 사무실 출입 권한, 그리고 Anthropic의 기존 내부 안전성 팀과 대체로 comparable한 권한을 받게 된다. 또한 평가자들은 위험, 사고 및 Anthropic의 안전성 관행에 관한 조사 결과를 회사의 편집 통제 없이 공개적으로 보고할 수 있다. 다만 Amodei는 민감한 고객 정보나 법률상 비밀이 보장되는 문서의 공개를 제한할 권리를 Anthropic이 보유한다고 말했다.
Amodei의 두 번째 단계는 민주주의 국가의 프런티어 AI 기업들이 공통 안전성 기준을 마련하고 통제되지 않은 AI 발전에 대한 제한에 합의하자는 것이다. 반독점 혐의를 피하기 위해 정부가 참여할 가능성도 있다. 세 번째 단계는 중국을 비롯한 권위주의 국가들과 궁극적으로 국제적 공조를 추진하자는 내용이다. Amodei는 중국이 AI 개발을 선도할 가능성을 "미국과 세계에 중대한 위험"이라고 표현했다.
Amodei는 미국 기업들의 어떤 속도 둔화 조치도 중국에 대한 기술적 우위를 유지해야 한다고 주장했다. 이를 위해 첨단 칩 수출 제한을 계속하고, 자사가 최근 보고서에서 지적한 모델 증류를 방지하기 위한 노력을 강화하며, 모델의 지식을 구성하는 방대한 파일인 모델 가중치를 탈취당할 가능성에 대한 보호를 강화해야 한다고 촉구했다.
Altman과 Musk도 지지 표명
Altman은 몇 시간 뒤 속도 둔화 구상을 지지하며, OpenAI가 Amodei의 게시글에서 제안한 첫 단계를 이행하겠다고 밝혔다.
Altman은 "프런티어의 속도를 조절해야 한다는 Dario의 의견에 동의합니다"라고 X에 썼다. Altman은 최근 몇 주 동안 속도 둔화 논의가 OpenAI에서 "주요 논의 주제"였다고 덧붙였다.
Altman은 "독립 평가자들에게 직원과 유사한 접근 권한을 제공하겠다고 약속하는 것은 훌륭한 생각이며, 우리도 그렇게 하겠습니다"라고 썼다. 그는 OpenAI가 "곧" 더 많은 내용을 공유할 것이라고 덧붙였다.
OpenAI는 지난주 의회에 촉구했다 AI 기업을 위한 "지속 가능한 안전장치를 마련해야 한다"고 밝혔다. "AI 역량이 이를 관리할 책임이 있는 기관을 앞서가기 전에" 조치를 취해야 한다는 것이다. 이러한 안전장치에는 독립적인 평가, 사이버보안 요건 및 사고 보고가 포함된다.
Elon Musk도 X에서 Amodei의 에세이를 지지했다. 그는 자신의 게시글을 인용하며 "Dario가 옳다"라는 세 단어의 메시지를 남겼다. Musk는 현재 SpaceX가 소유한 xAI가 Anthropic의 제3자 평가자를 회사 내부에 상주시킨다는 제안을 도입할지에 대해서는 구체적으로 언급하지 않았다.
Bernie Sanders 상원의원도 의견을 내고, Amodei와 Musk, Altman이 이제 AI 개발 속도를 늦춰야 한다는 데 동의하고 있다면서도 이들의 제안은 충분히 과감하지 않다고 주장했다.
“시작인 것은 맞지만, 충분하지는 않다”고 Sanders는 X에 썼다. “절벽을 향해 질주하고 있을 때는 단순히 가속 페달에서 발을 떼는 데 그치지 않는다. 브레이크를 밟아야 한다.”
Sanders는 첨단 AI 개발을 전면 중단하고 인공 초지능을 금지할 것을 촉구했으며, Donald Trump 대통령과 중국 국가주석 Xi Jinping에게 다가오는 AI 정상회의에서 이 문제에 관한 국제 협정을 협상하라고 요구했다.
