전체 콘텐츠50개

오늘의 카드보통

쿼리, 키, 값 — 어텐션의 3형제

셀프 어텐션은 토큰마다 쿼리(내가 찾는 것), 키(내가 가진 것), 값(실제 내용) 세 벡터를 만듭니다. 쿼리와 키를 비교해 '얼마나 관련 있는지'를 구하고, 그 비율만큼 값을 섞어서 문맥이 반영된 새 표현을 만드는 것이 전체 과정입니다.

자세히 보기
오늘의 카드보통

모르는 단어가 없는 토크나이저

일반 사전식 토크나이저는 처음 보는 단어를 만나면 <unk> 같은 대체 토큰으로 뭉개버립니다. BPE는 단어를 더 작은 조각(부분단어)이나 심지어 알파벳 한 글자까지 쪼갤 수 있어서, 사실상 모든 단어를 어떻게든 표현할 수 있습니다.

자세히 보기
오늘의 카드보통

온도를 올리면 생기는 일

생성 온도를 낮추면 모델은 가장 확률 높은 단어만 고르는 안전한 선택을 반복합니다. 온도를 올리면 확률이 낮은 단어도 뽑힐 기회가 생겨 표현이 다채로워지지만, 너무 높이면 문법이 무너지거나 엉뚱한 문장이 나올 수 있습니다.

자세히 보기
오늘의 카드보통

지시 미세튜닝 vs 분류 미세튜닝

분류 미세튜닝은 '스팸이다/아니다'처럼 정해진 몇 개의 답 중 하나만 고르도록 특화 훈련합니다. 지시 미세튜닝은 반대로 훨씬 폭넓은 지시문을 이해하고 자유롭게 응답하도록 훈련해서, 하나의 모델로 번역·요약·질의응답 등 다양한 작업을 처리하게 만듭니다.

자세히 보기
오늘의 카드보통

GPT-2도 크기가 여러 개

가장 작은 GPT-2는 파라미터 1억 2,400만 개, 어텐션 헤드 12개, 임베딩 768차원입니다. 가장 큰 버전은 파라미터 15억 5,800만 개로 10배가 넘죠. 놀랍게도 핵심 구조는 완전히 동일하고, 반복되는 트랜스포머 블록 개수와 임베딩 차원만 다릅니다.

자세히 보기
오늘의 카드보통

구성성을 위한 메타학습

모델에게 개념을 조합하는 힘을 가르치는 학습 기법이다. 새로운 상황을 마주했을 때, 이미 배운 조각들을 적절히 섞어 의미와 추론을 만들도록 돕는다. 단순 반복이 아니라 개념 재조합을 통해 일반화 성능을 끌어올리는 데 사용할 수 있다.

자세히 보기
오늘의 카드보통

AI 옵저버빌리티

AI 옵저버빌리티는 에이전트, LLM, 마이크로서비스를 하나의 상관 맵으로 묶어 실시간으로 추적하는 관측 체계다. 추론에서 코드 실행까지 연결해 논리 이탈과 할루시네이션을 찾고, 정확도와 비용을 동시에 관리한다.

자세히 보기
오늘의 카드보통

RAG vs 미세 튜닝, 어느 쪽인가

새 지식이 자주 바뀌면 RAG, 톤과 형식을 고치면 미세 튜닝을 검토합니다. RAG는 지식 업데이트가 쉽고 튜닝은 반응성이 커요. 데이터의 성격이 방향을 정합니다.

자세히 보기
오늘의 카드보통

스케일링 법칙, 크기와 손실의 관계

일정한 조건에서 파라미터, 데이터, 연산량을 늘리면 손실이 거듭제곱 법칙에 가깝게 줄어드는 경향이 관찰됩니다. 이를 스케일링 법칙이라고 해요. 모든 능력이 자동으로 좋아진다는 보장은 아니므로 과제별 평가가 필요합니다.

자세히 보기
오늘의 카드보통

안전, 출력 필터링

모델의 출력을 다시 검사하는 단계예요. 민감한 내용을 걸러내거나 형식을 검증합니다. 출력이 그대로 서비스되지 않도록 하는 단계입니다.

자세히 보기
오늘의 카드보통

창발적 능력, 크기가 크면 새 기능이 생겨요

모델 규모가 커질 때 일부 평가 능력이 급격히 좋아지는 것처럼 보이는 현상을 창발적 능력이라 부릅니다. 평가 지표를 바꾸면 향상이 더 연속적으로 보인다는 반론도 있어요. 따라서 '갑자기 생긴 능력'인지는 아직 연구와 논쟁의 대상입니다.

자세히 보기
오늘의 카드보통

시드 값, 생성의 재현 가능성

시드는 난수 생성의 시작점을 고정해 출력 변동을 줄이는 설정입니다. 같은 모델, 입력, 실행 환경을 함께 고정하면 재현성이 높아져요. 서버나 연산 방식이 달라지면 같은 시드도 결과를 완전히 보장하지는 않습니다.

자세히 보기
오늘의 카드보통

RAG, 청킹은 어떻게 하나

문서를 작은 단위로 쪼개야 검색이 정확해져요. 너무 작으면 맥락이 끊기고 너무 크면 노이즈가 섞여요. 문서의 구조에 맞춰 쪼개는 게 핵심입니다.

자세히 보기
오늘의 카드보통

RNN, 순서를 기억하는 구조

입력의 순서를 처리하기 위해 이전 상태를 다음으로 넘깁니다. 문장이나 시계열 같은 순서 데이터에 맞아요. 단, 긴 문맥을 기억하기는 어려워했죠.

자세히 보기
오늘의 카드보통

트랜스포머, 2017년의 전환점

2017년 논문은 어텐션만으로 순서를 처리하는 구조를 소개했습니다. RNN 없이도 긴 문맥을 다룰 수 있어요. 이후 대규모 언어 모델의 기본 설계가 되었습니다.

자세히 보기
오늘의 카드보통

InstructGPT, 지시를 따르게 하려면

사전 훈련만 한 언어 모델은 사용자의 지시와 의도를 안정적으로 따르지 못할 수 있어요. 2022년 InstructGPT 연구는 사람의 시범과 선호도, 강화 학습을 이용해 GPT-3을 미세 조정했습니다. 평가에서는 더 작은 InstructGPT가 1750억 파라미터 GPT-3보다 선호되기

자세히 보기
오늘의 카드보통

보안, 프롬프트 인젝션을 막으려면

사용자 입력이 명령처럼 인식되면 모델이 이를 따를 수 있어요. 시스템 프롬프트에 사용자 입력은 데이터라고 명시하는 게 기본이에요. 권한은 최소화하고, 입력은 검증해야 합니다.

자세히 보기
오늘의 카드보통

어텐션, 어디를 보고 말할지 정해요

각 위치가 문맥 전체에서 어디에 얼마나 집중할지를 계산합니다. 2014년 기계 번역 연구에서 처음 제안되어 이후 트랜스포머의 기반으로 자리 잡았습니다. 이 메커니즘이 대규모 언어 모델의 핵심이에요.

자세히 보기
오늘의 카드보통

RAG, 검색 결과를 근거로 답하게 해요

질문에 맞는 문서를 찾아 생성 모델의 입력에 함께 넣는 구조예요. 2020년 RAG 논문은 검색기와 생성기를 결합해 지식 집약 과제를 풀었습니다. 잘못된 문서를 찾으면 답도 틀릴 수 있으므로 검색 결과와 인용을 함께 검증해야 합니다.

자세히 보기