유용한 사고방식
학습은 통제된 오류 수정입니다.
모델 내부에 조정 가능한 다이얼이 있다고 생각해 보세요. 예시가 입력되면 모델이 출력을 생성합니다. 평가 규칙은 그 출력이 얼마나 좋거나 나빴는지를 판단합니다. 학습은 다이얼을 어느 방향으로 돌릴지 계산하고, 다이얼을 조금 조정한 뒤 다시 시도하는 과정입니다.
이러한 “다이얼”은 수치로 된 모델 파라미터입니다. 평가 규칙은 목적 함수라고 합니다. 낮을수록 좋은 경우 그 점수를 흔히 손실이라고 부릅니다.
이 설명은 모델이 데이터를 “흡수한다”고 말하는 것보다 정확합니다. 데이터는 예시를 제공합니다. 목적 함수는 개선 방향을 제시합니다. 학습 알고리즘이 모델을 변경합니다.
training examples
|
v
model makes outputs
|
v
objective measures loss or reward
|
v
calculate each parameter's contribution
|
v
update parameters
|
+---------- repeat ----------+
held-out validation data checks whether the result transfersAI 학습의 작동 방식
정확한 방법은 모델과 목적 함수에 따라 다르지만, 신경망 학습은 일반적으로 다음 순환 과정을 따릅니다.
- 예시와 목적 함수를 준비합니다.학습 데이터는 입력과 레이블을 짝지을 수도 있고, 모델이 예측하도록 입력의 일부를 가릴 수도 있으며, 선호되는 출력에 대한 피드백을 포함할 수도 있습니다.
- 시작 모델을 선택합니다.학습은 새로 초기화된 파라미터로 시작할 수도 있고, 이미 학습된 모델로 시작할 수도 있습니다.
- 배치를 모델에 통과시킵니다.배치는 함께 처리되는 작은 예시 묶음입니다. 이 순전파는 추론과 비슷합니다. 현재 모델이 입력을 출력으로 변환합니다.
- 출력을 평가합니다.손실 함수는 목표 답변과의 거리를 측정할 수 있습니다. 다른 목적 함수는 선호되는 행동에 더 높은 보상을 부여할 수 있습니다.
- 기여도를 계산합니다.신경망에서는 역전파가 각 파라미터에 대한 그래디언트를 계산합니다. 그래디언트는 해당 파라미터를 조금 변경했을 때 손실이 어떻게 변할 것으로 예상되는지를 나타냅니다.
- 파라미터를 업데이트합니다.옵티마이저는 이러한 그래디언트를 사용해 실제 변경량을 결정합니다. 학습률은 일반적인 업데이트의 크기를 조절합니다.
- 반복하고 확인합니다.학습은 더 많은 배치에 걸쳐 계속됩니다. 별도의 검증 데이터는 업데이트를 생성한 예시를 넘어 개선이 확장되는지 확인합니다.
에포크는 학습 데이터셋을 한 번 모두 통과하는 것입니다. 학습은 에포크의 일부만 사용하거나 여러 에포크를 사용할 수 있습니다. 에포크는 진행의 단위일 뿐, 유용한 학습이 일어났다는 보장은 아닙니다.
이 순환 과정은 학습의 좁은 기술적 의미를 설명합니다. 실제로 사람들은 학습이라는 말을 데이터 수집 및 필터링, 목적 함수 선택, 실험 실행, 체크포인트 평가, 중단 시점 결정 등 학습을 둘러싼 더 큰 작업 흐름을 가리키는 데에도 사용합니다.
피드백은 항상 같은 형태가 아닙니다
“예측을 정답과 비교한다”는 표현은 좋은 출발점이지만, 정의로서는 너무 좁습니다.
- 지도 학습에서는 예시에 레이블이 포함됩니다. 예를 들어 이미지에 지정된 범주가 있습니다.
- 자기지도 학습에서는 데이터가 자체적으로 목표를 제공합니다. 언어 모델은 텍스트에서 가려진 부분이나 다음 부분을 예측하면서 학습할 수 있습니다.
- 강화 학습에서는 결과에 보상이 부여되고, 학습을 통해 더 높은 보상으로 이어지는 행동을 할 가능성이 높아집니다.
이 방법들은 학습 신호가 어디에서 오는지에 따라 다릅니다. 하지만 핵심 아이디어는 같습니다. 피드백을 사용해 모델의 파라미터를 목적 함수에 맞는 방향으로 변경하는 것입니다.
한 단계 학습 예시
파라미터가 하나인 모델 w를 생각해 보세요. 이 모델은 다음과 같이 예측합니다.
output = w × input모델은 w = 0.5에서 시작합니다. 학습 예시의 입력은 2이고 목표 출력은 4입니다.
첫 번째 예측은 다음과 같습니다.
0.5 × 2 = 1제곱 오차를 손실로 사용합니다.
(prediction - target)²
(1 - 4)² = 9이 예시에서 w에 대한 손실의 그래디언트는 -12입니다. 음수라는 것은 w를 증가시키면 손실이 줄어들 것이라는 뜻입니다. 학습률이 0.1일 때, 경사 하강법은 다음과 같이 업데이트합니다.
new w = old w - learning rate × gradient
new w = 0.5 - 0.1 × (-12)
new w = 1.7이제 예측값은 1.7 × 2 = 3.4이고, 제곱 오차는 0.36입니다. 한 번의 업데이트로 이 예시에 더 잘 맞게 되었습니다.
실제 모델에는 많은 파라미터가 있을 수 있으며, 학습은 보통 배치의 여러 신호를 결합합니다. 옵티마이저는 다양한 예시에 걸쳐 효과가 있는 변경을 찾아야 합니다. 한 배치를 개선하는 것만으로는 충분하지 않습니다. 모델은 보류된 데이터에서도 잘 작동해야 합니다.
학습이 중요한 이유
학습은 모델을 나중에 사용할 때 가능한 행동을 결정합니다.
아키텍처는 모델이 수행할 수 있는 계산의 종류를 정합니다. 학습은 그 아키텍처 안에서 특정 파라미터 값을 선택합니다. 이러한 값은 모델이 어떤 패턴에 반응하고 어떤 출력을 생성하려는 경향을 보일지 형성합니다.
목적 함수가 중요한 이유는 모델이 사람이 중요하게 여길 수 있는 모든 품질이 아니라, 자신이 받는 신호를 기준으로 최적화되기 때문입니다. 텍스트를 예측하도록 학습된 언어 모델은 다양한 언어 작업에 유용해질 수 있지만, 예측 손실만으로는 진실성, 안전성 또는 지시 준수가 직접 보장되지 않습니다. 이후 학습에서는 시연 데이터나 선호도 피드백을 사용해 이러한 행동 중 일부를 목표로 삼을 수 있습니다.
같은 이유로 데이터도 중요합니다. 모델은 자신이 이용할 수 있는 예시와 피드백으로부터만 학습 신호를 받을 수 있습니다. 데이터의 공백, 오류, 중복, 편향은 학습 결과에 영향을 줄 수 있습니다.
흔한 오해
학습은 모든 예시의 사본을 저장한다
학습은 파라미터를 변경합니다. 일반적으로 모델 내부에 학습 데이터셋을 행 단위로 검색할 수 있는 데이터베이스를 만드는 것은 아닙니다.
그래도 데이터가 반복되거나 모델이 데이터에 지나치게 맞춰 학습되면 일부 예시를 암기할 수 있습니다. 하지만 암기와 유용한 일반화는 서로 다른 결과입니다. 실제로 분리된 데이터에 대한 평가는 둘을 구분하는 데 도움이 됩니다.
학습 손실이 낮으면 모델이 좋은 것이다
손실이 낮다는 것은 측정된 데이터에서 모델이 학습 목표에 더 잘 맞는다는 뜻입니다. 이것만으로 모델이 새로운 사례에서 잘 작동하거나 목적 함수가 실제 목표를 포착한다는 사실이 증명되지는 않습니다.
학습 손실은 감소하지만 검증 성능이 나빠진다면 모델이 과적합되었을 수 있습니다. 즉, 새로운 사례를 희생하면서 학습 예시에 더 특화된 것입니다.
학습을 더 많이 할수록 모델은 항상 좋아진다
추가 업데이트는 도움이 될 수도 있고, 거의 효과가 없을 수도 있으며, 학습을 불안정하게 하거나 과적합을 증가시킬 수도 있습니다. 결과는 데이터, 목적 함수, 옵티마이저 설정, 모델 용량, 중단 결정에 따라 달라집니다.
채팅하는 동안 모델이 사용자에게서 학습한다
일반적인 AI 추론 중에 배포된 모델은 고정된 파라미터를 사용해 입력에 답합니다. 현재 대화의 정보는 파라미터를 변경하지 않고도 다음 출력에 영향을 줄 수 있습니다.
서비스 제공자는 제품과 데이터 정책에 따라 수집된 상호작용을 나중에 별도의 학습 과정에서 사용할 수 있습니다. 이는 대화 중 모델이 스스로 업데이트되는 것과는 다릅니다.
모든 모델은 처음부터 학습된다
학습은 기존 모델에서 시작할 수 있습니다. 사전 학습은 대규모 일반 데이터셋으로 폭넓은 능력을 구축합니다. 파인튜닝은 더 좁은 작업이나 도메인을 위해 학습을 계속합니다. 사후 학습은 행동을 형성하기 위한 이후 단계를 폭넓게 가리키는 표현이며, 파인튜닝과 선호도 기반 방법을 포함할 수 있습니다.
이러한 용어 사이의 경계는 완전히 표준화되어 있지 않습니다. 신뢰할 수 있는 판단 기준은 그 과정이 모델의 파라미터를 업데이트하는지 여부입니다. 프롬프트에 예시를 제공하면 모델을 학습시키지 않고도 출력이 바뀔 수 있습니다.
AI 시스템에서 학습의 위치
학습 실행의 결과물은 일반적으로 학습된 체크포인트이며, 여기에는 학습된 가중치와 기타 상태가 포함됩니다. 개발자는 후보 체크포인트를 평가하고 추가 학습이나 배포에 사용할 하나를 선택합니다.
배포는 다른 운영 단계의 시작입니다. 추론에서는 입력이 학습된 모델을 통과하여 예측, 분류 또는 생성된 콘텐츠를 만듭니다. 순전파는 두 단계 모두에서 나타납니다. 학습에는 피드백, 그래디언트 계산, 파라미터 업데이트가 추가됩니다.
다음에 읽을 내용
AI 추론이란 무엇인가요?를 읽고 파라미터 업데이트 순환이 중단되고 학습된 모델이 사용될 때 무엇이 달라지는지 알아보세요. 그런 다음 학습과 추론 비교를 통해 두 수명 주기 단계를 직접 비교해 보세요.