전체 콘텐츠9

오늘의 카드보통

쿼리, 키, 값 — 어텐션의 3형제

셀프 어텐션은 토큰마다 쿼리(내가 찾는 것), 키(내가 가진 것), 값(실제 내용) 세 벡터를 만듭니다. 쿼리와 키를 비교해 '얼마나 관련 있는지'를 구하고, 그 비율만큼 값을 섞어서 문맥이 반영된 새 표현을 만드는 것이 전체 과정입니다.

자세히 보기
오늘의 카드보통

모르는 단어가 없는 토크나이저

일반 사전식 토크나이저는 처음 보는 단어를 만나면 <unk> 같은 대체 토큰으로 뭉개버립니다. BPE는 단어를 더 작은 조각(부분단어)이나 심지어 알파벳 한 글자까지 쪼갤 수 있어서, 사실상 모든 단어를 어떻게든 표현할 수 있습니다.

자세히 보기
오늘의 카드보통

온도를 올리면 생기는 일

생성 온도를 낮추면 모델은 가장 확률 높은 단어만 고르는 안전한 선택을 반복합니다. 온도를 올리면 확률이 낮은 단어도 뽑힐 기회가 생겨 표현이 다채로워지지만, 너무 높이면 문법이 무너지거나 엉뚱한 문장이 나올 수 있습니다.

자세히 보기
오늘의 카드보통

지시 미세튜닝 vs 분류 미세튜닝

분류 미세튜닝은 '스팸이다/아니다'처럼 정해진 몇 개의 답 중 하나만 고르도록 특화 훈련합니다. 지시 미세튜닝은 반대로 훨씬 폭넓은 지시문을 이해하고 자유롭게 응답하도록 훈련해서, 하나의 모델로 번역·요약·질의응답 등 다양한 작업을 처리하게 만듭니다.

자세히 보기
오늘의 카드보통

GPT-2도 크기가 여러 개

가장 작은 GPT-2는 파라미터 1억 2,400만 개, 어텐션 헤드 12개, 임베딩 768차원입니다. 가장 큰 버전은 파라미터 15억 5,800만 개로 10배가 넘죠. 놀랍게도 핵심 구조는 완전히 동일하고, 반복되는 트랜스포머 블록 개수와 임베딩 차원만 다릅니다.

자세히 보기