대규모 언어 모델(LLM)은 대량의 언어 데이터 모음으로 학습하여 텍스트의 AI 모델로, 개연성 높은 텍스트 시퀀스를 처리하거나 생성합니다. 텍스트 생성에 사용되는 대부분의 LLM은 프롬프트를 입력받고 한 번에 작은 단위 하나씩 응답을 생성합니다.

언어 모델이 어느 규모부터 “대규모”가 되는지를 정하는 공식적인 기준은 없습니다. 이 명칭은 상대적입니다. 일반적으로 많은 학습 파라미터, 폭넓은 학습 데이터, 상당한 컴퓨팅 요구 사항, 그리고 하나의 좁은 언어 작업을 넘어서는 능력이 결합되어 있음을 의미합니다.

유용한 사고 모델

생성형 LLM을 시퀀스를 입력받아 가능한 후속 시퀀스에 대한 점수를 반환하는 함수라고 생각해 보세요.

시퀀스는 토큰으로 구성됩니다. 토큰은 모델이 처리하는 텍스트 단위로, 완전한 단어, 단어의 일부, 구두점 또는 기타 기호일 수 있습니다. 모델은 숨겨진 문단을 먼저 작성한 다음 이를 드러내는 방식으로 작동하지 않습니다. 대신 다음에 올 수 있는 내용을 평가하고, 토큰 하나를 선택해 시퀀스에 추가한 뒤 다시 실행합니다.

이 반복 과정이 핵심입니다:

flowchart LR
    A[Prompt and prior output] --> B[LLM scores possible next tokens]
    B --> C[One token is selected]
    C --> D[Selected token is appended]
    D --> B

따라서 모델이 자체적으로 생성한 출력은 다음 입력의 일부가 됩니다. 초기의 선택 하나가 그 뒤의 모든 선택을 바꿀 수 있습니다.

이 사고 모델은 LLM을 데이터베이스라고 부르는 것보다 더 정확합니다. 학습을 통해 모델이 본 자료를 재현할 수는 있지만, 일반적인 생성은 저장된 문장 모음을 검색해 가장 가까운 일치 항목을 붙여 넣는 방식으로 이루어지지 않습니다. 모델은 현재 시퀀스에 학습된 수치적 관계를 적용합니다.

LLM의 작동 방식

LLM에는 학습과 사용이라는 서로 다른 두 단계가 있습니다.

사전 학습 중에는

텍스트가 토큰으로 분할됩니다. 모델에는 해당 텍스트에서 만든 예측 문제가 주어집니다. 인과 언어 모델은 앞선 토큰을 바탕으로 다음 토큰을 예측합니다. 다른 언어 모델은 숨겨진 토큰을 복원하거나 한 시퀀스를 다른 시퀀스로 변환하는 방식으로 학습합니다.

각 예측은 오류 신호를 생성합니다. 학습은 더 나은 예측이 더 높은 확률을 갖도록 모델의 수치 가중치를 반복적으로 조정합니다. 많은 예제를 거치면서 이러한 가중치는 철자, 문법, 문체, 사실, 코드, 아이디어 간 관계와 관련된 재사용 가능한 패턴을 포착합니다.

트랜스포머 아키텍처는 각 표현을 계산할 때 모델이 사용 가능한 시퀀스에서 관련된 부분을 결합하도록 돕습니다. 트랜스포머는 LLM의 지배적인 아키텍처이지만, 영구적인 정의의 일부는 아닙니다. 다른 아키텍처로도 대규모 언어 모델을 만들 수 있습니다.

사전 학습은 기본 모델을 만들지만, 반드시 유용한 어시스턴트를 만드는 것은 아닙니다. 추가 학습을 통해 모델이 지시를 더 잘 따르고, 특정 종류의 답변을 선호하며, 특정 요청을 거부하도록 만들 수 있습니다. 이러한 단계는 모델의 행동을 바꾸지만, 모델을 데이터베이스로 만들거나 출력이 참임을 보장하지는 않습니다.

생성 중에는

모델이 추론을 수행할 때 학습된 가중치는 고정되어 있습니다. 프롬프트와 제공된 기타 컨텍스트는 토큰으로 변환됩니다. 모델은 가능한 모든 다음 토큰에 대한 점수를 계산합니다. 그런 다음 소프트웨어가 디코딩 규칙을 사용해 토큰을 선택합니다.

매번 점수가 가장 높은 토큰을 선택하는 방법도 있습니다. 여러 개연성 높은 토큰 중에서 샘플링하는 방법도 있습니다. 샘플링을 사용하면 모델의 가중치가 바뀌지 않더라도 동일한 프롬프트에 대해 서로 다른 응답이 생성될 수 있습니다.

토큰이 선택되면 시퀀스에 추가됩니다. 모델은 프롬프트와 지금까지 생성된 모든 내용을 조건으로 삼아 새로운 분포를 계산합니다. 모델이 중지 토큰을 선택하거나, 출력 한도에 도달하거나, 주변 소프트웨어가 생성을 중지하면 생성이 끝납니다.

생성 예시

현재 텍스트가 다음과 같다고 가정해 보겠습니다:

프랑스의 수도는

설명을 위해 모델이 다음에 올 수 있는 네 토큰에 다음과 같은 확률을 부여한다고 가정해 보겠습니다:

Possible next tokenIllustrative probability
Paris91%
Lyon3%
located2%
a1%

생략된 가능성들이 나머지 확률을 나누어 가집니다. 이 숫자는 작동 방식을 보여 주기 위해 만든 것이며, 특정 모델에서 측정한 값이 아닙니다.

시스템이 파리를 선택하면 시퀀스는 다음과 같이 됩니다:

프랑스의 수도는 파리

이제 모델은 이 더 긴 시퀀스를 평가합니다. 가능한 다음 토큰에는 문장을 이어 가는 구두점이나 단어가 포함될 수 있습니다. 하나가 선택되면 이 과정이 반복됩니다.

이 예시에서 세 가지 유용한 사실을 도출할 수 있습니다.

첫째, 모델에는 별도의 “질문에 답하기” 프로그램이 필요하지 않습니다. 질문, 번역 요청, 코드 예시, 요약 지시는 모두 텍스트로 표현할 수 있으며, 그 후속 내용이 해당 작업을 암시할 수 있습니다.

둘째, 확률이 높은 후속 내용이 검증된 사실과 같은 것은 아닙니다. 학습 목표는 현실과 직접 대조하는 것이 아니라 데이터에 대한 예측 적합도를 높이는 것입니다. 거짓된 문장도 매끄러운 후속 내용이 될 수 있습니다.

셋째, 출력은 경로에 의존합니다. 가능성이 낮거나 잘못된 토큰이 선택되면 이후 토큰은 그 선택을 맥락으로 삼아 생성됩니다. 모델은 이를 바로잡기 위해 돌아가는 대신 잘못된 전제에서 일관되게 이어 갈 수 있습니다.

LLM이 다양한 작업을 수행할 수 있는 이유

크고 다양한 사전 학습을 통해 모델은 반복적으로 나타나는 여러 구조에 노출됩니다. 여기에는 질문 뒤에 답변이 오는 구조, 코드 뒤에 주석이 오는 구조, 주장 뒤에 근거가 오는 구조, 지시 뒤에 완료된 작업이 오는 구조가 포함됩니다. 이러한 구조를 예측하는 법을 학습하면 재사용할 수 있는 표현이 만들어집니다.

프롬프트는 모델을 사용하는 순간에 작업을 지정할 수도 있습니다. 원하는 결과를 설명하거나 예시를 제공하면 모델은 이를 조건으로 삼아 후속 내용을 생성합니다. 작업 정보가 새로운 가중치 업데이트를 통해 설치되는 것이 아니라 입력에 제공되기 때문에 이를 흔히 컨텍스트 내 학습이라고 부릅니다.

따라서 “다음 토큰 예측”은 그 결과로 나타나는 행동을 지나치게 단순하게 들리게 할 수 있습니다. 목표는 단순하지만, 이를 수행하는 학습된 함수는 단순하지 않습니다. 일반적인 자동 완성과 LLM은 서로 관련된 예측 문제를 해결하지만, 모델의 용량, 컨텍스트 활용 방식, 학습의 폭, 적용할 수 있는 패턴의 범위에서 크게 다릅니다.

LLM이 중요한 이유

하나의 사전 학습 모델이 입력을 바꾸는 것만으로 초안 작성, 정보 추출, 분류, 번역, 요약, 질의응답, 코드 생성을 지원할 수 있습니다. 따라서 언어는 소프트웨어를 위한 유연한 인터페이스가 됩니다.

이러한 유연성은 위험도 만듭니다. LLM의 출력은 권위 있는 출처에서 조회한 것이 아니라 생성된 것입니다. 결과는 틀리거나, 편향되거나, 일관되지 않거나, 프롬프트의 표현에 민감할 수 있습니다. 올바른 질문은 단순히 LLM이 어떤 주제를 “알고 있는가”가 아닙니다. 신뢰성은 작업, 학습 데이터와 제공된 컨텍스트, 디코딩 방식, 그리고 주변 시스템이 수행하는 검증에 따라 달라집니다.

LLM은 AI 제품을 구성하는 여러 계층 중 하나일 뿐입니다. LLM에 사용자 계정, 영구 메모리, 웹 액세스, 비공개 문서 또는 작업을 수행할 권한이 자동으로 부여되는 것은 아닙니다. 이러한 기능은 모델을 둘러싼 소프트웨어에서 제공됩니다.

흔한 오해

“LLM은 챗봇이다”

LLM은 언어를 처리하거나 생성하는 모델입니다. AI 챗봇은 LLM을 대화형 인터페이스, 지시, 검색, 조정, 메모리 및 기타 소프트웨어와 결합한 제품일 수 있습니다. 동일한 LLM을 채팅 인터페이스 없이 사용할 수도 있습니다.

“모델은 답을 찾아본다”

모델은 일반적으로 가중치와 현재 컨텍스트를 바탕으로 후속 내용을 계산합니다. 제품이 별도로 웹을 검색하거나 문서를 검색해 그 결과를 프롬프트에 넣을 수는 있지만, 이는 주변의 AI 하네스가 제공하는 기능이지 LLM 자체가 검색을 수행했다는 증거는 아닙니다.

“유창한 언어는 모델이 이해한다는 증거다”

연구자들은 이해를 측정하는 하나의 검사에 합의하지 않았습니다. LLM은 유용한 언어 능력을 보이고 복잡한 작업을 지원하는 내부 표현을 형성할 수 있습니다. 그렇다고 해서 인간과 같은 의미, 경험, 의도 또는 세계에 대한 기반이 확립되는 것은 아닙니다. “이해한다”를 모든 것을 설명하는 표현으로 사용하기보다 측정된 행동을 구체적으로 설명하는 편이 더 명확합니다.

“그저 자동 완성일 뿐이므로 새로운 일을 할 수 없다”

LLM은 자기회귀 예측기이지만, “그저”라는 말은 모델이 학습한 내용과 모델이 조건으로 삼을 수 있는 컨텍스트의 양이라는 중요한 부분을 가립니다. LLM은 학습 데이터에 완전한 문장으로 존재하지 않았던 방식으로 패턴을 결합할 수 있습니다. 새로운 출력이 나온다고 해서 그 안의 모든 주장이 옳다는 증거가 되는 것은 아닙니다.

“대규모에는 정확한 기준이 있다”

최소 파라미터 수, 학습 토큰 수 또는 컴퓨팅 규모를 정하는 공식적인 정의는 없습니다. 소형 언어 모델과 LLM의 경계는 사용 방식과 기술에 따라 달라집니다. 규모에 대한 주장은 비교하는 수량을 명시할 때만 의미가 있습니다.

LLM이 더 큰 시스템에 포함되는 방식

기본적인 스택은 다음과 같습니다:

  1. LLM은 컨텍스트를 가능한 언어 후속 내용으로 매핑합니다.
  2. 하네스는 컨텍스트를 준비하고, 모델을 호출하며, 데이터나 도구에 연결할 수 있습니다.
  3. 챗봇은 이 시스템을 대화 형태로 보여 줍니다.
  4. 그러면 AI 에이전트는 작업을 선택하고, 결과를 확인하며, 목표를 향해 계속 진행할 수 있는 반복 루프를 추가합니다.

이러한 계층을 분리해 두면 제품의 주장을 더 쉽게 평가할 수 있습니다. “어시스턴트가 웹을 검색했다”는 전체 시스템을 설명합니다. “LLM이 검색어를 생성하고 반환된 텍스트를 해석했다”는 모델의 역할을 더 정확하게 설명합니다.

다음으로 읽을 내용

LLM이 처리하는 단위를 이해하려면 AI에서 토큰이란 무엇인가요?를 읽어 보세요. 그런 다음 한 번의 생성 중 사용할 수 있는 정보의 한도를 설명하는 컨텍스트 윈도우란 무엇인가요?를 살펴보고, 모델의 가중치가 학습되는 방식을 알아보려면 AI에서 학습이란 무엇인가요?를, 학습된 모델을 사용할 때 일어나는 일을 알아보려면 AI에서 추론이란 무엇인가요?를 읽어 보세요.