모달리티라는 용어는 정보가 표현되거나 경험되는 서로 다른 방식을 의미합니다. 문단, 사진, 음성 녹음, 깊이 센서 판독값은 서로 다른 모달리티입니다. 이들은 구조가 다르지만 동일한 사건을 설명할 수 있습니다.모달리티는 정보가 표현되거나 경험되는 서로 다른 방식을 의미합니다. 문단, 사진, 음성 녹음, 깊이 센서 판독값은 서로 다른 모달리티입니다. 이들은 구조가 다르지만 동일한 사건을 설명할 수 있습니다.
하나의 작업, 여러 종류의 근거
식당 영수증 사진을 업로드하고 다음과 같이 입력한다고 가정해 보겠습니다.
Ana는 수프를, Bo는 파스타를 먹었고, 샐러드는 함께 먹었습니다. 각자의 음식 금액에 비례하여 세금을 나누세요.
가격은 이미지에 있습니다. 누가 무엇을 먹었고 무엇을 함께 먹었는지에 대한 규칙은 텍스트에 있습니다. 어느 한 입력만으로는 충분하지 않습니다. 답하려면 모델은 “수프”와 “샐러드” 같은 단어를 영수증의 올바른 영역과 연결하고, 해당 가격을 계산에 반영하며, 작성된 규칙을 따라야 합니다.
이 연결이 핵심 개념입니다. 멀티모달 AI는 단지 여러 입력을 나란히 놓는 것이 아닙니다. 한 모달리티의 정보가 다른 모달리티의 정보를 해석하거나 사용하는 방식에 영향을 주어야 합니다.
이는 멀티모달 AI가 “인간의 감각처럼 작동한다”고 말하는 것보다 더 정확한 설명입니다. 사람은 시각, 청각, 언어를 결합하지만, AI 모델은 인간의 경험이 아니라 인코딩된 데이터를 받습니다. 이 비교는 서로 다른 증거 채널을 결합한다는 수준에서만 유용합니다.
멀티모달 AI의 작동 방식
서로 다른 아키텍처가 다양한 방식으로 멀티모달 기능을 구현합니다. 일반적인 파이프라인은 네 단계로 구성됩니다.
1. 각 입력 인코딩하기
원시 픽셀, 음파, 텍스트는 형태가 서로 다릅니다. 인코더라고 하는 모달리티별 구성 요소는 각 입력을 학습된 특징을 담은 숫자 배열로 변환합니다.인코더는 각 입력을 학습된 특징을 담은 숫자 배열로 변환합니다.
영수증 이미지의 경우 특징은 문자, 항목, 레이아웃과 관련된 시각적 패턴을 보존할 수 있습니다. 지시문의 경우 텍스트를 처리 가능한 단위로 나누고 숫자 표현으로 변환합니다. 모델은 두 입력이 처음부터 같은 형태일 것을 요구하지 않습니다.
2. 관련 정보 정렬하기
모델은 서로 다른 모달리티에서 어떤 부분들이 대응하는지 학습해야 합니다. 이미지와 짝지어진 캡션, 전사문과 짝지어진 음성, 설명과 짝지어진 동영상은 학습 중 이러한 연결의 예를 제공합니다.
정렬에는 완벽한 일대일 대응이 필요하지 않습니다. 한 문장이 이미지 전체를 설명할 수 있고, 한 단어가 작은 영역을 가리킬 수 있으며, 하나의 소리가 여러 동영상 프레임에 걸쳐 이어질 수 있습니다. 모델은 완전한 기호적 지도를 만드는 대신 유용한 통계적 대응 관계를 학습합니다.
3. 근거 결합하기
표현들이 상호작용할 공간이 필요합니다. 이 단계는 흔히 융합이라고 합니다.융합이라고 합니다.
일부 시스템은 특징을 초기에 결합하여 함께 처리합니다. 일부 시스템은 각 모달리티가 자체 파이프라인을 상당 부분 거친 후 결과를 결합합니다. 많은 최신 모델은 이 두 방식의 중간 형태를 사용하여 선택된 이미지, 오디오 또는 동영상 특징이 언어 처리에 영향을 주도록 합니다.
Flamingo는 한 가지 설계를 보여 주었습니다. 즉, 사전 학습된 비전 구성 요소와 언어 구성 요소를 각각 두고 그 사이에 학습된 계층을 연결한 것입니다. Gemini 기술 보고서는 처음부터 모달리티 전반에 걸쳐 모델을 공동 학습하는 다른 학습 방식을 설명합니다. 두 방식 모두 멀티모달입니다. “멀티모달”은 특정 아키텍처가 아니라 기능을 가리킵니다.FlamingoGemini 기술 보고서는 처음부터 모달리티 전반에 걸쳐 모델을 공동 학습하는 다른 방식을 설명합니다. 두 방식 모두 멀티모달입니다. “멀티모달”은 특정 아키텍처가 아니라 기능을 가리킵니다.
4. 요청된 출력 생성하기
근거를 결합한 후 모델이나 시스템은 출력을 생성합니다. 출력은 텍스트, 이미지, 오디오, 범주, 이미지 내 위치 또는 제어 신호일 수 있습니다.
입력과 출력 지원 여부는 별도로 결정되는 기능입니다. 모델은 다음과 같을 수 있습니다.
- 텍스트와 이미지를 입력받고 텍스트를 출력할 수 있습니다.
- 텍스트, 오디오, 동영상을 입력받고 텍스트를 출력할 수 있습니다.
- 텍스트를 입력받고 이미지를 출력할 수 있습니다.
- 혼합 입력을 받고 둘 이상의 출력 모달리티를 생성할 수 있습니다.
“멀티모달”이라는 명칭만으로는 이 중 어느 경우에 해당하는지 알 수 없습니다.
Image ──> image encoder ──┐
│
Audio ──> audio encoder ──┼─> alignment and fusion ─> task output
│
Text ───> text encoder ───┘실제 설계에서는 이러한 단계들을 통합하거나 반복하거나 별도의 모델을 사용할 수 있습니다. 도식은 필수적인 배치가 아니라 기능을 보여 줍니다.
예제로 살펴보기
영수증과 작성된 분할 지시로 돌아가 보겠습니다.
- 시각 입력은 영수증의 텍스트와 레이아웃을 보존하는 특징으로 변환됩니다.
- 작성된 지시는 텍스트 표현으로 변환됩니다.
- 학습을 통해 얻은 연결은 “수프”, “파스타”, “샐러드”를 영수증의 해당 항목과 연결하는 데 도움을 줍니다.
- 모델은 이러한 가격을 누가 무엇을 먹었는지에 대한 규칙과 결합합니다.
- 모델은 각 사람의 소계와 세금 분담액을 보여 주는 텍스트 답변을 생성합니다.
여러 가지 실패가 발생할 수 있습니다. 흐릿한 숫자는 가격을 잘못 인식하게 만들 수 있습니다. 모델은 “샐러드”를 잘못된 줄과 정렬할 수 있습니다. 모든 줄을 정확히 읽더라도 세금 규칙을 잘못 적용할 수 있습니다. 멀티모달리티는 이미지 내용을 직접 옮겨 적을 필요를 줄여 주지만, 인식, 정렬 또는 추론 오류를 없애지는 않습니다.
구현 방식은 어떤 주장이 정확한지에도 영향을 줍니다. 한 구성 요소가 먼저 광학 문자 인식(OCR), 즉 이미지에서 문자를 추출하는 소프트웨어를 사용하고 텍스트 전용 모델이 그 결과로 나온 전사문을 처리한다면, 그 애플리케이션은 멀티모달 시스템입니다. 그렇다고 그 안의 텍스트 전용 모델 자체가 멀티모달 모델이 되는 것은 아닙니다. 한 모델이 학습된 이미지 특징과 지시를 직접 결합한다면 그 모델 자체가 멀티모달입니다.
멀티모달 AI가 중요한 이유
많은 유용한 작업에는 중요한 정보를 잃지 않고 깔끔한 텍스트로만 변환하기 어려운 증거가 포함됩니다. 양식에서는 레이아웃이 의미를 전달합니다. 음성에서는 억양과 타이밍이 정보를 전달합니다. 움직임은 동영상을 정렬되지 않은 사진 묶음과 구분합니다. 도표와 장면에서는 공간적 관계가 중요합니다.
모달리티를 결합하면 모호성을 해소할 수 있습니다. “왜 이 부분에서 새고 있나요?”와 같은 서면 질문만으로는 “이 부분”이 무엇을 가리키는지 알 수 없습니다. 함께 제공된 이미지가 그 대상을 지정해 줄 수 있습니다. 오디오 트랙은 겉으로는 작동 중이고 정상적으로 들리는 모터와 이상한 소리를 내는 모터를 구분하는 데 도움을 줄 수 있습니다.
멀티모달 인터페이스는 수동 변환도 줄일 수 있습니다. 모든 내용을 먼저 자세한 서면 설명으로 바꾸는 대신 사진으로 가리키거나, 지시를 말로 전달하거나, 도표를 첨부할 수 있습니다.
이는 기회이지 보장은 아닙니다. 추가 모달리티는 관련 증거를 포함하고 모델이 그 증거를 정확히 정렬할 수 있을 때만 도움이 됩니다. 서로 충돌하거나 품질이 낮은 입력은 새로운 오류를 일으킬 수 있습니다.
흔한 오해
“멀티모달”이면 모든 미디어 유형으로 무엇이든 할 수 있다
그렇지 않습니다. 기능에는 입력과 출력이라는 두 측면이 있습니다. 각 방향에서 지원되는 모달리티와 하나의 요청에서 이들을 결합할 때의 제한을 확인해야 합니다.
모든 이미지 생성기는 범용 멀티모달 모델이다
텍스트-이미지 모델은 한 모달리티에서 다른 모달리티로 변환하므로, 넓은 정의에 따르면 멀티모달이라고 할 수 있습니다. 그러나 이것이 이미지를 검사하거나, 두 이미지를 비교하거나, 오디오를 이해하거나, 혼합 입력에 대해 추론할 수 있다는 뜻은 아닙니다. 명칭보다 구체적인 입력-출력 계약이 더 유용합니다.
멀티모달 AI와 생성형 AI는 같은 것이다
두 용어는 서로 다른 축을 설명합니다. 생성형 AI는 새로운 콘텐츠를 생성합니다. 멀티모달 AI는 둘 이상의 모달리티를 처리하거나 서로 연결합니다. 시스템은 둘 다일 수도 있고, 하나만일 수도 있으며, 둘 다 아닐 수도 있습니다.생성형 AI는 새로운 콘텐츠를 생성합니다. 멀티모달 AI는 둘 이상의 모달리티를 처리하거나 서로 연결합니다. 시스템은 둘 다일 수도 있고, 하나만일 수도 있으며, 둘 다 아닐 수도 있습니다.
이미지와 센서 판독값을 분석하여 정해진 안전 범주를 선택하는 모델은 멀티모달이지만 반드시 생성형인 것은 아닙니다. 텍스트 전용 글쓰기 모델은 생성형이지만 단일 모달입니다. 현재 많은 어시스턴트는 두 가지 모두에 해당합니다.
멀티모달 AI는 하나로 통합된 모델이어야 한다
항상 그런 것은 아닙니다. 연구자는 하나의 학습된 모델을 멀티모달 모델이라고 부를 수 있고, 제품 팀은 연결된 구성 요소들의 시스템을 멀티모달 시스템이라고 부를 수 있습니다. 모달리티가 어디에서 어떻게 상호작용하는지 확인해야 합니다. 별도의 구성 요소가 독립적으로 답을 생성하고 애플리케이션이 이를 함께 표시하기만 한다면, 그 시스템이 반드시 모달리티 간 추론을 수행한 것은 아닙니다.
모달리티가 많을수록 항상 정확도가 높아진다
추가 증거가 도움이 될 수 있지만, 관련이 없거나 노이즈가 많거나 서로 모순될 수도 있습니다. 성능은 데이터 품질, 정렬, 작업, 모델 학습 방식에 따라 달라집니다. 확신에 찬 답변이 모델이 모달리티를 올바르게 연결했다는 증거는 아닙니다.
더 넓은 시스템에서 멀티모달 AI의 위치
멀티모달리티는 여러 수준에서 나타날 수 있습니다.
- 데이터:학습 예제가 서로 다른 모달리티를 짝지어 제공하거나 번갈아 배치합니다.
- 모델:학습된 구성 요소가 모달리티 표현을 정렬하고 결합합니다.
- 애플리케이션:제품이 파일, 센서 피드 또는 모델 출력을 구성 요소 간에 전달합니다.
- 인터페이스:사용자가 텍스트, 음성, 이미지 또는 동영상으로 소통할 수 있습니다.
이러한 수준을 하나의 주장으로 뭉뚱그려서는 안 됩니다. 멀티모달 인터페이스 뒤에는 특화된 모델들의 파이프라인이 숨겨져 있을 수 있습니다. 멀티모달 모델이 텍스트 전용 인터페이스 뒤에 있을 수도 있습니다. 이미지와 텍스트를 짝지은 데이터로 학습한 모델이 자유로운 대화가 아니라 좁은 범위의 매칭 작업만 지원할 수도 있습니다.
제품이나 모델을 평가할 때는 다음 세 가지 질문을 사용하세요.
- 동일한 작업에서 어떤 모달리티를 입력으로 받을 수 있는가?
- 어떤 모달리티를 출력할 수 있는가?
- 그 모달리티들의 정보는 어디에서 어떻게 상호작용하는가?
이러한 답이 “멀티모달”이라는 말 자체보다 더 많은 정보를 알려 줍니다.
다음 학습 단계
더 넓은 모델 개념은 “AI 모델이란 무엇인가요?”에서, 콘텐츠를 생성하는 능력과 모달리티를 결합하는 능력의 차이는 “생성형 AI란 무엇인가요?”에서 확인하세요. 모델 카드나 제품 페이지를 읽을 때는 입력과 출력을 따로 정리한 다음, 둘 이상의 모달리티에서 얻은 정보가 필요한 작업으로 테스트되었다는 근거를 찾아보세요.AI 모델이란 무엇인가요?생성형 AI란 무엇인가요?생성형 AI란 무엇인가요?콘텐츠를 생성하는 능력과 모달리티를 결합하는 능력의 차이를 구분하세요. 모델 카드나 제품 페이지를 읽을 때는 입력과 출력을 따로 정리한 다음, 둘 이상의 모달리티에서 얻은 정보가 필요한 작업으로 테스트되었다는 근거를 찾아보세요.