쉽게 이해하기
언어 모델은 다음 토큰에 대한 확률 분포를 출력하는데, 크로스 엔트로피 손실은 이 예측 확률이 실제 정답 토큰에 얼마나 낮은 확률을 부여했는지를 벌점으로 계산합니다. 이 값을 최소화하는 방향으로 가중치를 조정하는 것이 바로 LLM 훈련의 핵심 목표입니다.
모델이 예측한 확률과 실제 정답 사이의 차이를 측정하는 손실 함수
언어 모델은 다음 토큰에 대한 확률 분포를 출력하는데, 크로스 엔트로피 손실은 이 예측 확률이 실제 정답 토큰에 얼마나 낮은 확률을 부여했는지를 벌점으로 계산합니다. 이 값을 최소화하는 방향으로 가중치를 조정하는 것이 바로 LLM 훈련의 핵심 목표입니다.