파운데이션 모델은 머신러닝 모델입니다. 한 가지 작업만 수행하도록 만들어진 것이 아니라 다양한 작업에 맞게 조정할 수 있도록 광범위한 데이터로 학습됩니다. 완성된 애플리케이션이 아니라 재사용 가능한 출발점입니다.
유용한 사고 모델
“파운데이션”이라는 말은 모델이 하나의 체계에서 차지하는 위치를 나타냅니다.
broad training data
↓
pretraining
↓
foundation model
↙ ↓ ↘
prompt task fine-tuned
layer derivative
↘ ↓ ↙
downstream models and applications파운데이션에는 광범위한 사전 학습을 통해 학습된 패턴이 담겨 있습니다. 이후 단계에서는 이러한 패턴을 특정 작업에 맞게 활용합니다. 어떤 조정 모델은 지원 티켓을 분류하고, 다른 모델은 질문에 답하며, 또 다른 모델은 이미지와 텍스트 설명을 연결할 수 있습니다.
핵심적인 구분은 다음과 같습니다. 모델은 폭넓은 능력을 갖추고 있어도 특정 제품에 바로 사용할 수 있는 상태가 아닐 수 있습니다. “파운데이션”이 중요한 이유는 여러 개발자가 모든 작업을 처음부터 시작하지 않고 이를 재사용할 수 있기 때문입니다.
파운데이션 모델의 작동 방식
먼저 개발자는 광범위한 학습 데이터를 구성합니다. 여기서 “광범위하다”는 말은 의도한 도메인에 따라 상대적입니다. 언어 모델은 다양한 종류의 텍스트로 학습할 수 있고, 의료 영상 파운데이션 모델은 여러 유형의 스캔과 임상 환경에서 얻은 데이터로 학습할 수 있습니다. 광범위하다는 말이 존재하는 모든 종류의 데이터를 포함해야 한다는 뜻은 아닙니다.
다음으로 모델은 사전 학습을 거칩니다. 많은 파운데이션 모델은 자기지도 학습을 사용합니다. 즉, 데이터 자체가 학습 신호를 제공합니다. 텍스트 모델은 텍스트에서 가려진 부분이나 다음에 올 부분을 예측하면서 학습할 수 있습니다. 이미지-텍스트 모델은 어떤 캡션이 어떤 이미지와 연결되는지 학습할 수 있습니다. 구체적인 목표는 다르지만, 목적은 하나의 좁은 작업을 넘어 계속 유용하게 사용할 수 있는 패턴을 학습하는 것입니다.
사전 학습이 끝나면 체크포인트가 생성됩니다. 체크포인트는 모델이 학습한 값들을 저장해 둔 것입니다. 그런 다음 이 체크포인트를 여러 방식으로 조정할 수 있습니다.
- 프롬프트는 입력에 지시사항이나 예시를 제공합니다. 프롬프트는 즉각적인 동작을 바꾸지만 모델이 학습한 값 자체는 바꾸지 않습니다.
- 특정 작업용 레이어 추가는 모델의 내부 출력을 특정 결과로 변환하는 작은 구성 요소를 붙입니다. 예를 들어 여러 범주로 이루어진 결과를 생성하게 할 수 있습니다.
- 파인튜닝은 더 좁은 범위의 데이터셋으로 학습을 계속하는 방식입니다. 작업이나 도메인에서의 성능을 높이기 위해 학습된 값의 일부 또는 전체를 변경합니다.
- 시스템 통합은 모델을 검색, 데이터베이스, 도구, 규칙, 인터페이스와 연결합니다. 이때 기반 모델이 고정된 상태로 유지되더라도 애플리케이션이 할 수 있는 일이 달라집니다.
이러한 방법은 서로 결합할 수 있습니다. 그러나 어느 방법도 조정된 결과가 정확하거나 안전하거나 의도한 용도에 적합하다고 보장하지는 않습니다. 각 downstream 사용 사례에는 별도의 평가가 필요합니다.
구체적인 예시
한 회사가 광범위하게 사전 학습된 언어 모델을 바탕으로 고객 지원 티켓을 처리하려 한다고 가정해 보겠습니다.
빠른 프로토타입을 만들기 위해 팀은 허용된 분류 라벨과 몇 가지 예시를 포함한 프롬프트를 모델에 제공합니다. 모델이 학습한 값은 바뀌지 않습니다.
더 일관된 분류를 위해 팀은 분류 레이어를 추가하고 과거 티켓 데이터로 이를 파인튜닝합니다. 이렇게 하면 원래 모델에서 파생된 특정 작업용 모델이 만들어집니다.
고객이 직접 사용하는 지원 어시스턴트를 만들기 위해 팀은 모델을 승인된 도움말 문서, 계정 도구, 권한 확인 기능, 인터페이스와 연결합니다. 이 결과물은 단순히 파운데이션 모델 자체가 아니라, 모델을 중심으로 구축된 AI 시스템입니다.
동일한 출발 체크포인트가 프롬프트 기반 동작, 조정된 모델, 완성된 애플리케이션이라는 세 가지 결과를 뒷받침했습니다. 이러한 재사용성이 바로 이 모델을 파운데이션 모델로 만드는 특징입니다.
이러한 패턴은 가상의 이야기가 아닙니다. 최초의 BERT 연구에서는 하나의 사전 학습 언어 모델을 11개의 언어 작업에 맞게 조정했으며, 많은 경우 출력 레이어 하나만 추가했습니다. 이후 연구에서는 다양한 재사용 방식을 보여 주었습니다. GPT-3는 파인튜닝 없이 텍스트 지시사항과 예시만으로 작업을 수행했고, CLIP은 자연어 라벨을 사용해 특정 분류를 대상으로 별도로 학습되지 않은 이미지도 분류했습니다.
파운데이션 모델이 중요한 이유
파운데이션 모델은 비용이 많이 드는 광범위한 학습의 상당 부분을 공유된 사전 학습 단계로 옮깁니다. 그러면 downstream 팀은 작업 데이터, 평가, 제품 설계, 안전장치에 집중할 수 있습니다.
공유된 기반은 지렛대 효과를 만듭니다. 파운데이션의 개선 사항 하나가 여러 사용 사례에 혜택을 줄 수 있습니다. 동시에 집중 위험도 발생합니다. 파운데이션에 편향, 보안 취약점, 체계적인 실패가 포함되어 있다면 많은 조정 모델과 제품이 이를 물려받을 수 있습니다. 연구자들은 이를 동질화라고 부릅니다. 즉, 많은 시스템이 동일한 소수의 기반 방법이나 모델에 의존하게 되는 현상입니다.
조정을 통해 특정 사용 사례의 문제를 줄일 수는 있지만, 그렇다고 파운데이션의 한계가 자동으로 사라지는 것은 아닙니다. 정교하게 만들어진 애플리케이션은 공통된 출처를 감출 수는 있어도 없애지는 못합니다.
흔한 오해
“파운데이션 모델”은 “대규모 언어 모델”을 의미한다
LLM은 언어에 초점을 맞추고 규모가 크다는 점으로 정의됩니다. 파운데이션 모델은 광범위한 사전 학습과 downstream 재사용을 기준으로 정의됩니다. 많은 LLM이 파운데이션 모델이지만, 이 범주에는 이미지, 오디오, 로보틱스, 생물학, 그리고 여러 데이터 유형의 조합을 위한 모델도 포함됩니다.
모든 파운데이션 모델은 콘텐츠를 생성한다
최초의 정의에서 생성 능력은 필수 조건이 아닙니다. 파운데이션 모델은 재사용 가능한 특징을 생성하거나, 입력의 순위를 매기거나 분류하거나, 텍스트와 이미지를 연결할 수 있습니다. 공급업체 웹페이지에서는 자사 제품이 판매하는 모델이 생성 모델인 경우가 많기 때문에 “파운데이션 모델”을 생성 모델의 약칭처럼 사용하는 경우가 많지만, 이는 더 좁은 용법입니다.
규모가 크기만 하면 충분하다
파운데이션 모델과 다른 모델을 구분하는 보편적인 파라미터 수 기준은 없습니다. 하나의 고정된 작업을 위해 학습된 매우 큰 모델이라고 해서 자동으로 파운데이션 모델이 되는 것은 아닙니다. 더 중요한 기준은 광범위한 데이터로 학습되었고 다양한 downstream 작업을 위한 의미 있는 기반으로 활용될 수 있는지입니다.
정책 문서는 “이중 용도 파운데이션 모델”과 같이 규제를 받는 일부 범주에 대해 수치 기준을 정할 수 있습니다. 이러한 기준은 해당 정책 용어의 적용 범위를 정의할 뿐, 기술적 범주 전체를 정의하는 것은 아닙니다.
프롬프트가 모델을 학습시킨다
일반적인 프롬프트는 한 번의 상호작용을 위한 임시 입력을 제공합니다. 파인튜닝은 추가 학습을 통해 학습된 값을 업데이트합니다. 둘 다 작업에 맞게 동작을 조정할 수 있지만, 모델 자체를 바꾸는 것은 후자뿐입니다.
“파운데이션”은 신뢰할 수 있다는 뜻이다
이 용어는 품질을 인증하지 않습니다. 최초 제안자들은 downstream 시스템이 그 아래에 있는 것에 의존한다는 점을 강조하기 위해 이 용어를 선택했습니다. 약한 파운데이션은 강한 파운데이션이 유용한 능력을 확산시키는 것만큼 효과적으로 실패를 확산시킬 수 있습니다.
“파운데이션 모델”은 라이선스 방식을 알려 준다
그렇지 않습니다. 파운데이션 모델은 다운로드 가능한 가중치를 제공할 수도 있고, 가중치를 제한할 수도 있으며, API로만 접근할 수 있을 수도 있습니다. “오픈”, “오픈 웨이트”, “클로즈드”는 모델이 파운데이션 역할을 하는지 여부가 아니라 접근성과 라이선스를 설명하는 용어입니다.
더 넓은 시스템에서의 위치
파운데이션 모델은 광범위한 사전 학습과 구체적인 사용 사이에 위치합니다.
파운데이션 모델 이전에는 체크포인트를 만들기 위해 사용된 데이터, 학습 목표, 아키텍처, 연산 자원, 평가가 있습니다. 이후에는 프롬프트, 파인튜닝된 파생 모델, 특정 작업용 구성 요소, 검색 소스, 안전 제어, 도구, 사용자 인터페이스가 있습니다.
이러한 계층을 분리해 두면 주장을 평가하기가 쉬워집니다. 어시스턴트가 최신 사실을 검색한다면, 그 정보는 모델의 사전 학습이 아니라 연결된 검색 시스템에서 제공된 것일 수 있습니다. 챗봇이 요청을 거부한다면 그 동작은 모델 학습, 시스템 지시사항, 외부 필터, 또는 여러 계층이 함께 만든 결과일 수 있습니다. 눈에 보이는 제품만으로는 어떤 계층이 해당 작업을 수행했는지 알 수 없습니다.
다음 단계
“파운데이션 모델”이라는 라벨을 접하면 두 가지를 확인하세요. 첫째, 모델이 하나의 좁은 작업을 넘어 여러 작업을 지원할 수 있을 만큼 광범위하게 학습되었는지 확인합니다. 둘째, 살펴보는 제품에서 모델이 어떤 방식으로 조정되었는지 확인합니다. 모델 카드나 기술 보고서를 보면 사전 학습의 범위, 의도된 downstream 사용 사례, 조정 방법, 알려진 한계를 파악하는 데 도움이 됩니다.
이러한 세부 정보가 없다면 라벨만으로는 능력, 신뢰성, 접근성, 안전성에 대해 알 수 있는 것이 거의 없습니다.
더 넓은 모델 개념은 AI 모델이란 무엇인가요?에서, 학습된 파라미터가 만들어지는 방식은 AI에서 학습이란 무엇인가요?에서, 파운데이션 모델 애플리케이션의 주요한 한 종류인 생성형 AI는 생성형 AI란 무엇인가요?에서 알아보세요.