임베딩과 유사도
임베딩으로 의미적 유사도를 계산하는 원리.
자세히 보기SEARCH THE WIKI
용어, 오늘의 카드, 검증된 프롬프트를 한 번에 찾아보세요.
전체 콘텐츠50개
임베딩으로 의미적 유사도를 계산하는 원리.
자세히 보기검색 증강 생성이 동작하는 흐름.
자세히 보기창의성과 일관성 사이 균형 잡기.
자세히 보기도구를 호출하는 에이전트의 기본 구조.
자세히 보기셀프 어텐션은 토큰마다 쿼리(내가 찾는 것), 키(내가 가진 것), 값(실제 내용) 세 벡터를 만듭니다. 쿼리와 키를 비교해 '얼마나 관련 있는지'를 구하고, 그 비율만큼 값을 섞어서 문맥이 반영된 새 표현을 만드는 것이 전체 과정입니다.
자세히 보기일반 사전식 토크나이저는 처음 보는 단어를 만나면 <unk> 같은 대체 토큰으로 뭉개버립니다. BPE는 단어를 더 작은 조각(부분단어)이나 심지어 알파벳 한 글자까지 쪼갤 수 있어서, 사실상 모든 단어를 어떻게든 표현할 수 있습니다.
자세히 보기생성 온도를 낮추면 모델은 가장 확률 높은 단어만 고르는 안전한 선택을 반복합니다. 온도를 올리면 확률이 낮은 단어도 뽑힐 기회가 생겨 표현이 다채로워지지만, 너무 높이면 문법이 무너지거나 엉뚱한 문장이 나올 수 있습니다.
자세히 보기분류 미세튜닝은 '스팸이다/아니다'처럼 정해진 몇 개의 답 중 하나만 고르도록 특화 훈련합니다. 지시 미세튜닝은 반대로 훨씬 폭넓은 지시문을 이해하고 자유롭게 응답하도록 훈련해서, 하나의 모델로 번역·요약·질의응답 등 다양한 작업을 처리하게 만듭니다.
자세히 보기가장 작은 GPT-2는 파라미터 1억 2,400만 개, 어텐션 헤드 12개, 임베딩 768차원입니다. 가장 큰 버전은 파라미터 15억 5,800만 개로 10배가 넘죠. 놀랍게도 핵심 구조는 완전히 동일하고, 반복되는 트랜스포머 블록 개수와 임베딩 차원만 다릅니다.
자세히 보기모델에게 개념을 조합하는 힘을 가르치는 학습 기법이다. 새로운 상황을 마주했을 때, 이미 배운 조각들을 적절히 섞어 의미와 추론을 만들도록 돕는다. 단순 반복이 아니라 개념 재조합을 통해 일반화 성능을 끌어올리는 데 사용할 수 있다.
자세히 보기AI 옵저버빌리티는 에이전트, LLM, 마이크로서비스를 하나의 상관 맵으로 묶어 실시간으로 추적하는 관측 체계다. 추론에서 코드 실행까지 연결해 논리 이탈과 할루시네이션을 찾고, 정확도와 비용을 동시에 관리한다.
자세히 보기새 지식이 자주 바뀌면 RAG, 톤과 형식을 고치면 미세 튜닝을 검토합니다. RAG는 지식 업데이트가 쉽고 튜닝은 반응성이 커요. 데이터의 성격이 방향을 정합니다.
자세히 보기사전 학습 모델에 추가 데이터를 줘 과업을 맞춥니다. 전체 튜닝은 비싸고, LoRA 같은 방법은 가볍게 할 수 있어요. 데이터가 충분해야 효과가 커져요.
자세히 보기일정한 조건에서 파라미터, 데이터, 연산량을 늘리면 손실이 거듭제곱 법칙에 가깝게 줄어드는 경향이 관찰됩니다. 이를 스케일링 법칙이라고 해요. 모든 능력이 자동으로 좋아진다는 보장은 아니므로 과제별 평가가 필요합니다.
자세히 보기유사도 검색에 최적화된 저장소예요. 수천 만 개의 벡터에서도 가까이를 찾습니다. RAG 파이프라인의 핵심 구성요소입니다.
자세히 보기이미지를 작은 조각으로 쪼개어 트랜스포머의 입력으로 줍니다. 2020년 제안된 방식은 이미지 인식의 새 흐름이 되었어요. 멀티모달 모델의 기반이에요.
자세히 보기모델의 출력을 다시 검사하는 단계예요. 민감한 내용을 걸러내거나 형식을 검증합니다. 출력이 그대로 서비스되지 않도록 하는 단계입니다.
자세히 보기2018년 공개된 모델은 앞뒤 문맥을 함께 봅니다. 비어 토큰을 채우는 과제로 사전 학습했어요. 분류나 요약 같은 이해 과제에서 강했습니다.
자세히 보기모델 규모가 커질 때 일부 평가 능력이 급격히 좋아지는 것처럼 보이는 현상을 창발적 능력이라 부릅니다. 평가 지표를 바꾸면 향상이 더 연속적으로 보인다는 반론도 있어요. 따라서 '갑자기 생긴 능력'인지는 아직 연구와 논쟁의 대상입니다.
자세히 보기시드는 난수 생성의 시작점을 고정해 출력 변동을 줄이는 설정입니다. 같은 모델, 입력, 실행 환경을 함께 고정하면 재현성이 높아져요. 서버나 연산 방식이 달라지면 같은 시드도 결과를 완전히 보장하지는 않습니다.
자세히 보기모델이 학습한 특정 문서를 그대로 출력할 수 있어요. 이것은 의도된 기억인지 오인지 구별해야 합니다. 비밀을 프롬프트에 넣기 전에는 이 위험을 알아둬야 해요.
자세히 보기이미지를 입력으로 주면 모델이 보고 답합니다. ViT 같은 인코더가 이미지를 토큰으로 변환해요. 질문과 이미지를 함께 보내면 됩니다.
자세히 보기문서를 작은 단위로 쪼개야 검색이 정확해져요. 너무 작으면 맥락이 끊기고 너무 크면 노이즈가 섞여요. 문서의 구조에 맞춰 쪼개는 게 핵심입니다.
자세히 보기공식 벤치마크는 모델의 상한을 보여줘요. 하지만 내 과제에서는 직접 만든 평가 세트가 더 중요해요. 두 가지를 함께 봐야 합니다.
자세히 보기2022년 공개된 음성 인식 모델이에요. 대량의 음성-텍스트 쌍으로 훈련되어 개방 모델입니다. 번역까지 함께 제공합니다.
자세히 보기손실이 가장 빨리 줄어드는 방향으로 매개변수를 조금씩 고칩니다. 그 방향은 손실의 기울기로 계산됩니다. 학습률은 내리는 걸음의 크기를 정해요.
자세히 보기각 토큰이 문장 내 다른 토큰과 얼마나 관련되는지를 직접 계산해요. 이 관계가 의미 표현에 녹아들어요. 이 방식이 대규모 언어 모델 능력의 뿌리입니다.
자세히 보기동일한 질문에 두 모델의 출력을 비교해요. 사용자의 선택이 데이터가 돼요. 이 방법이 가장 직접적인 평가입니다.
자세히 보기입력의 순서를 처리하기 위해 이전 상태를 다음으로 넘깁니다. 문장이나 시계열 같은 순서 데이터에 맞아요. 단, 긴 문맥을 기억하기는 어려워했죠.
자세히 보기어텐션 시각화 같은 도구로 내부의 시선을 볼 수 있어요. 완전한 설명은 아니지만 추론의 단서를 줍니다. 신뢰를 쌓기 위한 도구 중 하나예요.
자세히 보기출입을 건너뛰는 연결을 두어 깊은 망에서도 신호가 유지됩니다. 레지넷은 이 기법으로 깊이가 깊은 망을 훈련할 수 있었어요. 이제는 표준 설계가 되었죠.
자세히 보기동일한 앞부분이 반복되면 그 계산을 캐시에 둡니다. 서버 측 캐싱은 비용을 크게 낮춰요. 프롬프트 구조 설계가 비용을 좌우합니다.
자세히 보기노이즈로 바꾼 이미지를 다시 되돌리는 법을 배웁니다. Stable Diffusion은 이 방식으로 2022년 공개됐어요. 이미지 생성의 표준이 되었습니다.
자세히 보기긴 문맥만으로 모든 것을 담을 수는 없어요. 관련 내용만 검색해 컨텍스트에 채우는 구조가 안정적입니다. 검색 품질이 전체를 좌우합니다.
자세히 보기왼쪽으로만 보고 다음 토큰을 맞추는 구조예요. 이 단순 구조가 스케일 업 하면 다양한 능력을 보여주었습니다. GPT-1은 117M 파라미터, GPT-3은 1750억 규모입니다.
자세히 보기토큰 단위가 모델의 입력을 정합니다. 잘 자르면 의미 단위로 분해가 잘 돼요. 나쁘게 자르면 문맥이 깨져요. 언어에 맞는 토크나이저가 중요합니다.
자세히 보기어텐션으로 토큰 간 거리가 먼 관계도 직접 계산합니다. 이게 순차 처리의 병목 없이 긴 문맥을 다룰 수 있어요. 이 설계가 대규모 언어 모델의 기반이 됐습니다.
자세히 보기게이트 구조로 정보를 흘리거나 버리는 법을 학습합니다. RNN의 소실 기울기 문제를 크게 줄여줬어요. 시계열 처리의 표준이었죠.
자세히 보기첫 토큰까지의 시간이 체감 속도의 핵심이에요. 전체 완성 시간보다 이 지연이 중요합니다. 서버 측 큐잉과 캐싱이 이 지연을 좌우합니다.
자세히 보기2021년 공개된 모델은 문장과 그림의 대응을 배웁니다. '무엇이 무엇을 닮았는지'를 비교해 검색이 가능해요. 비전과 언어를 잇는 대표 모델이에요.
자세히 보기출력에서의 오차가 각 층으로 전달되며 매개변수가 조정됩니다. 계단식 규칙으로 연산 그래프를 거스르는 원리예요. 딥러닝의 실제 계산 방식입니다.
자세히 보기2017년 논문은 어텐션만으로 순서를 처리하는 구조를 소개했습니다. RNN 없이도 긴 문맥을 다룰 수 있어요. 이후 대규모 언어 모델의 기본 설계가 되었습니다.
자세히 보기사전 훈련만 한 언어 모델은 사용자의 지시와 의도를 안정적으로 따르지 못할 수 있어요. 2022년 InstructGPT 연구는 사람의 시범과 선호도, 강화 학습을 이용해 GPT-3을 미세 조정했습니다. 평가에서는 더 작은 InstructGPT가 1750억 파라미터 GPT-3보다 선호되기
자세히 보기프롬프트에 몇 줄의 예를 넣으면 모델이 그 형식을 따라 줍니다. 새로운 데이터를 훈련할 필요 없이 동작해요. 이 능력이 프롬프트 엔지니어링의 기반입니다.
자세히 보기사용자 입력이 명령처럼 인식되면 모델이 이를 따를 수 있어요. 시스템 프롬프트에 사용자 입력은 데이터라고 명시하는 게 기본이에요. 권한은 최소화하고, 입력은 검증해야 합니다.
자세히 보기각 위치가 문맥 전체에서 어디에 얼마나 집중할지를 계산합니다. 2014년 기계 번역 연구에서 처음 제안되어 이후 트랜스포머의 기반으로 자리 잡았습니다. 이 메커니즘이 대규모 언어 모델의 핵심이에요.
자세히 보기각 에이전트가 역할을 나눠 함께 문제를 푼다는 설계예요. 단순 작업은 분산 처리가 빠르지만, 조율 비용도 커요. AutoGen 같은 프레임워크가 이 영역을 다룹니다.
자세히 보기질문에 맞는 문서를 찾아 생성 모델의 입력에 함께 넣는 구조예요. 2020년 RAG 논문은 검색기와 생성기를 결합해 지식 집약 과제를 풀었습니다. 잘못된 문서를 찾으면 답도 틀릴 수 있으므로 검색 결과와 인용을 함께 검증해야 합니다.
자세히 보기모델의 출력을 또 다른 모델로 평가하는 기법이에요. 평가자가 빠르고 일관성이 있어요. 단, 평가자의 편향도 함께 봐야 합니다.
자세히 보기모델은 근거가 약한 질문에 단정적으로 답할 수 있어요. '불확실'을 인식하는 프롬프트와 구조 설계가 필요합니다. 예측 확률을 함께 받는 것도 방법이에요.
자세히 보기