쉽게 이해하기
신경망은 범주형 데이터를 직접 계산할 수 없으므로, 각 토큰을 실수로 이루어진 고정 길이 벡터로 매핑합니다. 의미가 비슷한 단어일수록 벡터 공간에서 가까운 위치에 놓이게 훈련되며, 이 벡터들은 훈련 과정에서 함께 최적화됩니다. GPT-3의 임베딩 크기는 12,288차원에 달합니다.
단어나 토큰 같은 이산적인 데이터를 연속적인 숫자 벡터로 바꾸는 방법
신경망은 범주형 데이터를 직접 계산할 수 없으므로, 각 토큰을 실수로 이루어진 고정 길이 벡터로 매핑합니다. 의미가 비슷한 단어일수록 벡터 공간에서 가까운 위치에 놓이게 훈련되며, 이 벡터들은 훈련 과정에서 함께 최적화됩니다. GPT-3의 임베딩 크기는 12,288차원에 달합니다.