쉽게 이해하기
원본 트랜스포머가 번역을 위해 인코더와 디코더를 함께 썼다면, GPT는 디코더 블록만 쌓아 이전까지 생성한 단어를 바탕으로 다음 단어를 예측하는 자기회귀(autoregressive) 방식을 취합니다. 구조 자체는 상대적으로 단순하지만, 이 방식을 아주 큰 규모로 반복 학습시키면 번역·요약·코드 작성 같은, 명시적으로 훈련받지 않은 능력까지 자연히 따라옵니다.
트랜스포머의 디코더 부분만 사용해 한 번에 한 단어씩 텍스트를 생성하는 모델
원본 트랜스포머가 번역을 위해 인코더와 디코더를 함께 썼다면, GPT는 디코더 블록만 쌓아 이전까지 생성한 단어를 바탕으로 다음 단어를 예측하는 자기회귀(autoregressive) 방식을 취합니다. 구조 자체는 상대적으로 단순하지만, 이 방식을 아주 큰 규모로 반복 학습시키면 번역·요약·코드 작성 같은, 명시적으로 훈련받지 않은 능력까지 자연히 따라옵니다.