쉽게 이해하기

언어 모델은 다음 토큰에 대한 확률 분포를 출력하는데, 크로스 엔트로피 손실은 이 예측 확률이 실제 정답 토큰에 얼마나 낮은 확률을 부여했는지를 벌점으로 계산합니다. 이 값을 최소화하는 방향으로 가중치를 조정하는 것이 바로 LLM 훈련의 핵심 목표입니다.