OpenAI는 AI 훈련을 위한 안전 지침을 공개하며, 개발자들이 프런티어 강화학습 훈련을 어떤 형태로든 계속하기 전에 체계적인 안전 문서를 준비해야 한다고 밝혔다.

월요일 블로그 게시물에서 ChatGPT 개발사는 AI 훈련을 시작하기 전에 "안전성 입증 자료" 문서를 마련하도록 요구하는 관행을 체계화하기 위한 프레임워크를 개발 중이라고 밝혔다.

OpenAI는 이러한 안전성 입증 자료가 기술 스택의 세 영역, 즉 정렬 훈련, 격리, 모니터링을 다뤄야 한다고 설명했다.

"이러한 보호 조치는 모델이 정렬에서 벗어난 행동을 시도하지 않도록 하고, 설령 그런 행동을 하더라도 격리를 뚫기 어렵게 하며, 피해가 발생하기 전에 모니터링이 이를 포착하도록 하는 데 도움이 됩니다."라고 팀은 밝혔다.

구체적으로 정렬 훈련은 정렬에서 벗어난 행동을 막기 위해 설계된다. 여기에는 훈련 환경 검토, 평가자 조정, 오프라인 평가, 과거 사고를 바탕으로 한 백테스팅이 포함된다.

격리는 잠재적 피해를 제한하기 위한 것이다. OpenAI는 여러 계층의 인프라 보안을 갖춘 강화된 샌드박스를 제안했으며, 훈련 체크포인트를 활용해 이러한 환경을 레드팀 방식으로 점검하는 방안도 제시했다. 또한 샘플 간 통신에도 제한을 부과할 예정이다.

한편 모니터링은 정렬에서 벗어난 행동을 조기에 감지하기 위한 것으로, 재현율 목표, 새로운 평가 데이터 포인트, 신속한 경보를 통해 뒷받침된다.

Frontier Model Releases per Month by Lab

Frontier Model Releases per Month by Lab

  • OpenAI
  • Google
  • Anthropic
  • xAI
  • Meta AI
  • NVIDIA
  • Z.ai
  • Other
SOURCE: Epoch AI — Frontier AI Models

안전 우려

OpenAI의 안전 지침은 회사가 안전 우려를 이유로 10월로 예정됐던 GPT-6.1 Astra 출시를 취소했다고 발표한 당일 나왔다.

OpenAI 안전 시스템 책임자인 Saachi Jain은 월요일 The Latent와 공유한 성명에서 안전과 정렬에 관한 모든 사안에는 "상충 관계가 있다"고 밝혔다.

Jain은 "[GPT-6.1 Astra]가 모델의 게으름과 같은 여러 측면에서는 개선됐지만, 범위와 권한 내에서 머무르는 점, 그리고 수행한 작업의 유형을 사용자에게 어떻게 전달하는지에 있어서는 기준을 완전히 충족하지 못했습니다"라고 말했다.

안전은 프런티어 AI 훈련을 둘러싼 논의에서 중요한 부분이 됐다. 지난주 OpenAI CEO Sam Altman과 Anthropic CEO Dario Amodei는 모두 유엔 총회에서 발언하며 책임 있는 AI 개발을 위한 더욱 긴밀한 공조를 촉구했다.

Altman은 행사에서 "우리는 과거에 일방적으로 속도를 늦춘 적이 있습니다. 앞으로도 그렇게 할 것입니다. 경쟁에서 기업을 앞서는 것이 성급한 결정을 내릴 이유는 아닙니다"라고 말했다.

한편 Anthropic은 기업공개(IPO) 투자설명서에서 투자자들에게 경고할 계획이라고 Reuters가 월요일 보도했다. Claude 개발사는 특히 고도화된 AI 모델이 "자기 보존 행동"을 보일 경우 AI가 "인류에 재앙적이거나 실존적인 위험"을 초래할 수 있다고 경고했다.