쉽게 이해하기

신경망은 범주형 데이터를 직접 계산할 수 없으므로, 각 토큰을 실수로 이루어진 고정 길이 벡터로 매핑합니다. 의미가 비슷한 단어일수록 벡터 공간에서 가까운 위치에 놓이게 훈련되며, 이 벡터들은 훈련 과정에서 함께 최적화됩니다. GPT-3의 임베딩 크기는 12,288차원에 달합니다.