AI 에이전트
도구를 사용해 목표를 수행하는 시스템
자세히 보기SEARCH THE WIKI
용어, 오늘의 카드, 검증된 프롬프트를 한 번에 찾아보세요.
전체 콘텐츠88개
도구를 사용해 목표를 수행하는 시스템
자세히 보기모델과 에이전트, 마이크로서비스를 하나의 상관 맵으로 연결해 실시간으로 동작을 관찰하고 오류를 추적하는 관측 체계
자세히 보기출력을 만들 때 입력의 어느 부분이 중요한지 가중치로 계산하는 방법
자세히 보기마이크로소프트의 오픈소스 멀티에이전트 대화 프레임워크로, 에이전트 간 비동기 메시징과 이벤트 기반 상호작용을 지원한다.
자세히 보기문장 안의 빈칸을 채우도록 훈련되어 분류·이해 작업에 강한 트랜스포머 모델
자세히 보기여러 LLM 에이전트가 수평적으로 정보를 공유하고 기여도에 따라 구성원을 교체하는 동적 다중 에이전트 구조이다.
자세히 보기단어나 토큰 같은 이산적인 데이터를 연속적인 숫자 벡터로 바꾸는 방법
자세히 보기명시적으로 훈련받지 않았는데도 모델 규모가 커지면서 저절로 나타나는 능력
자세히 보기입력을 이해하는 부분과 출력을 생성하는 부분을 나눈 신경망 구조
자세히 보기몇 개 예시로 태스크 유도
자세히 보기사전 훈련된 모델을 레이블이 있는 작은 데이터셋으로 추가 학습시키는 것
자세히 보기사전 훈련만 마치고 아직 특정 작업에 특화되지 않은 범용 모델
자세히 보기트랜스포머의 디코더 부분만 사용해 한 번에 한 단어씩 텍스트를 생성하는 모델
자세히 보기고성능 추론 모델이 작은 생산 모델의 출력을 대신 평가하는 자동 평가 방식이다.
자세히 보기대규모 언어 모델을 참고 정책으로 활용하여 추천 시스템의 다양성과 새로움을 강화하는 강화학습 알고리즘입니다. 기존 강화학습의 무작위 탐색 한계를 극복하고, 언어 모델의 지식을 통해 사용자 관심사와 부합하는 새로운 아이템을 탐색합니다.
자세히 보기여러 개의 어텐션을 병렬로 두어 서로 다른 종류의 관계를 동시에 포착
자세히 보기토큰의 순서 정보를 임베딩에 더해주는 방법
자세히 보기레이블 없는 대량의 텍스트에서 다음 단어 예측으로 모델을 훈련하는 첫 단계
자세히 보기외부 지식 검색과 텍스트 생성을 결합해 최신·근거 있는 답을 만드는 방법
자세히 보기외부 지식 소스에서 관련 정보를 실시간으로 검색해 생성 과정에 반영하는 하이브리드 AI 아키텍처
자세히 보기문장 안의 각 단어가 같은 문장의 다른 단어들과 관계를 계산하는 어텐션
자세히 보기출력의 무작위성 조절 파라미터
자세히 보기텍스트 생성 시 다양성과 일관성 사이의 균형을 조절하는 방법
자세히 보기어텐션 메커니즘만으로 문장 전체를 한 번에 처리하는 신경망 구조
자세히 보기예시 없이 태스크 수행
자세히 보기예시 없이(제로샷), 또는 아주 적은 예시만으로(퓨샷) 새 작업을 수행하는 능력
자세히 보기모델이 배운 개념을 조합해 새로운 상황에 적용하는 구성 일반화 능력을 강화하는 메타학습 기법이다.
자세히 보기검색 증강 생성 파이프라인에서 벡터 저장소와 대안으로 사용되는 외부 지식 저장 및 검색 기술이다.
자세히 보기AI가 목표를 달성하기 위해 자율적으로 계획을 수립하고, 외부 도구를 호출하며, 기억을 유지하고 환경 변화에 적응하도록 지원하는 소프트웨어 아키텍처.
자세히 보기데이터나 작업이 순차적으로 들어오는 환경에서, 새 지식을 학습하면서도 이전에 습득한 지식의 손실(파국적 망각)을 줄이려는 머신러닝 방법론.
자세히 보기픽셀 단위로 이미지의 각 부분을 클래스로 분류하는 작업에서 한 걸음 더 나아가, 동일한 클래스에 속하더라도 서로 다른 개체들을 개별적으로 식별하고 경계선을 정확히 추출하는 컴퓨터 비전 기술이다.
자세히 보기다음 API 코드로 문서를 생성해줘: {{code}}
자세히 보기다음 문장에서 굵게 표시한 단어를 생성할 때, 셀프 어텐션이라면 어떤 이전 단어들에 가장 높은 가중치를 줄지 추론해줘. 각 후보 단어마다 이유를 한 줄로 설명하고, 가중치가 높은 순서대로 정렬해줘. 문장: {{문장을 넣고 굵게 표시할 단어를 **단어** 형식으로 표시}}
자세히 보기다음 버그 설명으로 재현 단계를 단계별로 작성해줘: {{bug}}
자세히 보기다음 코드를 보안·성능·가독성 관점에서 리뷰해줘: {{code}}
자세히 보기다음 상황에 맞는 temperature와 top-k 값을 추천하고, 왜 그 값이 적절한지 근거를 설명해줘. 그리고 반대로 너무 극단적인 값을 썼을 때 어떤 문제가 생길지도 한 문장씩 알려줘. 상황: {{예: 법률 문서 요약처럼 정확성이 중요한 작업}}
자세히 보기너는 AI 연구 논문을 실무 개발자에게 통역해주는 역할이야. 아래 논문(또는 논문 링크/초록)을 다음 형식으로 요약해줘. 1. 한 문장 요약 2. 이 논문이 푼 문제 (기존 방식의 한계 포함) 3. 핵심 아이디어 (수식 없이 개념으로) 4. 실제로 내 프로젝트에 적용한다면 어떤 부분에
자세히 보기다음 텍스트를 {{lang}}로, 원래 톤을 유지해서 번역해줘: {{text}}
자세히 보기임베딩으로 의미적 유사도를 계산하는 원리.
자세히 보기검색 증강 생성이 동작하는 흐름.
자세히 보기창의성과 일관성 사이 균형 잡기.
자세히 보기도구를 호출하는 에이전트의 기본 구조.
자세히 보기셀프 어텐션은 토큰마다 쿼리(내가 찾는 것), 키(내가 가진 것), 값(실제 내용) 세 벡터를 만듭니다. 쿼리와 키를 비교해 '얼마나 관련 있는지'를 구하고, 그 비율만큼 값을 섞어서 문맥이 반영된 새 표현을 만드는 것이 전체 과정입니다.
자세히 보기일반 사전식 토크나이저는 처음 보는 단어를 만나면 <unk> 같은 대체 토큰으로 뭉개버립니다. BPE는 단어를 더 작은 조각(부분단어)이나 심지어 알파벳 한 글자까지 쪼갤 수 있어서, 사실상 모든 단어를 어떻게든 표현할 수 있습니다.
자세히 보기생성 온도를 낮추면 모델은 가장 확률 높은 단어만 고르는 안전한 선택을 반복합니다. 온도를 올리면 확률이 낮은 단어도 뽑힐 기회가 생겨 표현이 다채로워지지만, 너무 높이면 문법이 무너지거나 엉뚱한 문장이 나올 수 있습니다.
자세히 보기분류 미세튜닝은 '스팸이다/아니다'처럼 정해진 몇 개의 답 중 하나만 고르도록 특화 훈련합니다. 지시 미세튜닝은 반대로 훨씬 폭넓은 지시문을 이해하고 자유롭게 응답하도록 훈련해서, 하나의 모델로 번역·요약·질의응답 등 다양한 작업을 처리하게 만듭니다.
자세히 보기가장 작은 GPT-2는 파라미터 1억 2,400만 개, 어텐션 헤드 12개, 임베딩 768차원입니다. 가장 큰 버전은 파라미터 15억 5,800만 개로 10배가 넘죠. 놀랍게도 핵심 구조는 완전히 동일하고, 반복되는 트랜스포머 블록 개수와 임베딩 차원만 다릅니다.
자세히 보기모델에게 개념을 조합하는 힘을 가르치는 학습 기법이다. 새로운 상황을 마주했을 때, 이미 배운 조각들을 적절히 섞어 의미와 추론을 만들도록 돕는다. 단순 반복이 아니라 개념 재조합을 통해 일반화 성능을 끌어올리는 데 사용할 수 있다.
자세히 보기AI 옵저버빌리티는 에이전트, LLM, 마이크로서비스를 하나의 상관 맵으로 묶어 실시간으로 추적하는 관측 체계다. 추론에서 코드 실행까지 연결해 논리 이탈과 할루시네이션을 찾고, 정확도와 비용을 동시에 관리한다.
자세히 보기새 지식이 자주 바뀌면 RAG, 톤과 형식을 고치면 미세 튜닝을 검토합니다. RAG는 지식 업데이트가 쉽고 튜닝은 반응성이 커요. 데이터의 성격이 방향을 정합니다.
자세히 보기사전 학습 모델에 추가 데이터를 줘 과업을 맞춥니다. 전체 튜닝은 비싸고, LoRA 같은 방법은 가볍게 할 수 있어요. 데이터가 충분해야 효과가 커져요.
자세히 보기일정한 조건에서 파라미터, 데이터, 연산량을 늘리면 손실이 거듭제곱 법칙에 가깝게 줄어드는 경향이 관찰됩니다. 이를 스케일링 법칙이라고 해요. 모든 능력이 자동으로 좋아진다는 보장은 아니므로 과제별 평가가 필요합니다.
자세히 보기유사도 검색에 최적화된 저장소예요. 수천 만 개의 벡터에서도 가까이를 찾습니다. RAG 파이프라인의 핵심 구성요소입니다.
자세히 보기이미지를 작은 조각으로 쪼개어 트랜스포머의 입력으로 줍니다. 2020년 제안된 방식은 이미지 인식의 새 흐름이 되었어요. 멀티모달 모델의 기반이에요.
자세히 보기모델의 출력을 다시 검사하는 단계예요. 민감한 내용을 걸러내거나 형식을 검증합니다. 출력이 그대로 서비스되지 않도록 하는 단계입니다.
자세히 보기2018년 공개된 모델은 앞뒤 문맥을 함께 봅니다. 비어 토큰을 채우는 과제로 사전 학습했어요. 분류나 요약 같은 이해 과제에서 강했습니다.
자세히 보기모델 규모가 커질 때 일부 평가 능력이 급격히 좋아지는 것처럼 보이는 현상을 창발적 능력이라 부릅니다. 평가 지표를 바꾸면 향상이 더 연속적으로 보인다는 반론도 있어요. 따라서 '갑자기 생긴 능력'인지는 아직 연구와 논쟁의 대상입니다.
자세히 보기시드는 난수 생성의 시작점을 고정해 출력 변동을 줄이는 설정입니다. 같은 모델, 입력, 실행 환경을 함께 고정하면 재현성이 높아져요. 서버나 연산 방식이 달라지면 같은 시드도 결과를 완전히 보장하지는 않습니다.
자세히 보기모델이 학습한 특정 문서를 그대로 출력할 수 있어요. 이것은 의도된 기억인지 오인지 구별해야 합니다. 비밀을 프롬프트에 넣기 전에는 이 위험을 알아둬야 해요.
자세히 보기이미지를 입력으로 주면 모델이 보고 답합니다. ViT 같은 인코더가 이미지를 토큰으로 변환해요. 질문과 이미지를 함께 보내면 됩니다.
자세히 보기문서를 작은 단위로 쪼개야 검색이 정확해져요. 너무 작으면 맥락이 끊기고 너무 크면 노이즈가 섞여요. 문서의 구조에 맞춰 쪼개는 게 핵심입니다.
자세히 보기공식 벤치마크는 모델의 상한을 보여줘요. 하지만 내 과제에서는 직접 만든 평가 세트가 더 중요해요. 두 가지를 함께 봐야 합니다.
자세히 보기2022년 공개된 음성 인식 모델이에요. 대량의 음성-텍스트 쌍으로 훈련되어 개방 모델입니다. 번역까지 함께 제공합니다.
자세히 보기손실이 가장 빨리 줄어드는 방향으로 매개변수를 조금씩 고칩니다. 그 방향은 손실의 기울기로 계산됩니다. 학습률은 내리는 걸음의 크기를 정해요.
자세히 보기각 토큰이 문장 내 다른 토큰과 얼마나 관련되는지를 직접 계산해요. 이 관계가 의미 표현에 녹아들어요. 이 방식이 대규모 언어 모델 능력의 뿌리입니다.
자세히 보기동일한 질문에 두 모델의 출력을 비교해요. 사용자의 선택이 데이터가 돼요. 이 방법이 가장 직접적인 평가입니다.
자세히 보기입력의 순서를 처리하기 위해 이전 상태를 다음으로 넘깁니다. 문장이나 시계열 같은 순서 데이터에 맞아요. 단, 긴 문맥을 기억하기는 어려워했죠.
자세히 보기어텐션 시각화 같은 도구로 내부의 시선을 볼 수 있어요. 완전한 설명은 아니지만 추론의 단서를 줍니다. 신뢰를 쌓기 위한 도구 중 하나예요.
자세히 보기출입을 건너뛰는 연결을 두어 깊은 망에서도 신호가 유지됩니다. 레지넷은 이 기법으로 깊이가 깊은 망을 훈련할 수 있었어요. 이제는 표준 설계가 되었죠.
자세히 보기동일한 앞부분이 반복되면 그 계산을 캐시에 둡니다. 서버 측 캐싱은 비용을 크게 낮춰요. 프롬프트 구조 설계가 비용을 좌우합니다.
자세히 보기노이즈로 바꾼 이미지를 다시 되돌리는 법을 배웁니다. Stable Diffusion은 이 방식으로 2022년 공개됐어요. 이미지 생성의 표준이 되었습니다.
자세히 보기긴 문맥만으로 모든 것을 담을 수는 없어요. 관련 내용만 검색해 컨텍스트에 채우는 구조가 안정적입니다. 검색 품질이 전체를 좌우합니다.
자세히 보기왼쪽으로만 보고 다음 토큰을 맞추는 구조예요. 이 단순 구조가 스케일 업 하면 다양한 능력을 보여주었습니다. GPT-1은 117M 파라미터, GPT-3은 1750억 규모입니다.
자세히 보기토큰 단위가 모델의 입력을 정합니다. 잘 자르면 의미 단위로 분해가 잘 돼요. 나쁘게 자르면 문맥이 깨져요. 언어에 맞는 토크나이저가 중요합니다.
자세히 보기어텐션으로 토큰 간 거리가 먼 관계도 직접 계산합니다. 이게 순차 처리의 병목 없이 긴 문맥을 다룰 수 있어요. 이 설계가 대규모 언어 모델의 기반이 됐습니다.
자세히 보기게이트 구조로 정보를 흘리거나 버리는 법을 학습합니다. RNN의 소실 기울기 문제를 크게 줄여줬어요. 시계열 처리의 표준이었죠.
자세히 보기첫 토큰까지의 시간이 체감 속도의 핵심이에요. 전체 완성 시간보다 이 지연이 중요합니다. 서버 측 큐잉과 캐싱이 이 지연을 좌우합니다.
자세히 보기2021년 공개된 모델은 문장과 그림의 대응을 배웁니다. '무엇이 무엇을 닮았는지'를 비교해 검색이 가능해요. 비전과 언어를 잇는 대표 모델이에요.
자세히 보기출력에서의 오차가 각 층으로 전달되며 매개변수가 조정됩니다. 계단식 규칙으로 연산 그래프를 거스르는 원리예요. 딥러닝의 실제 계산 방식입니다.
자세히 보기2017년 논문은 어텐션만으로 순서를 처리하는 구조를 소개했습니다. RNN 없이도 긴 문맥을 다룰 수 있어요. 이후 대규모 언어 모델의 기본 설계가 되었습니다.
자세히 보기사전 훈련만 한 언어 모델은 사용자의 지시와 의도를 안정적으로 따르지 못할 수 있어요. 2022년 InstructGPT 연구는 사람의 시범과 선호도, 강화 학습을 이용해 GPT-3을 미세 조정했습니다. 평가에서는 더 작은 InstructGPT가 1750억 파라미터 GPT-3보다 선호되기
자세히 보기프롬프트에 몇 줄의 예를 넣으면 모델이 그 형식을 따라 줍니다. 새로운 데이터를 훈련할 필요 없이 동작해요. 이 능력이 프롬프트 엔지니어링의 기반입니다.
자세히 보기사용자 입력이 명령처럼 인식되면 모델이 이를 따를 수 있어요. 시스템 프롬프트에 사용자 입력은 데이터라고 명시하는 게 기본이에요. 권한은 최소화하고, 입력은 검증해야 합니다.
자세히 보기각 위치가 문맥 전체에서 어디에 얼마나 집중할지를 계산합니다. 2014년 기계 번역 연구에서 처음 제안되어 이후 트랜스포머의 기반으로 자리 잡았습니다. 이 메커니즘이 대규모 언어 모델의 핵심이에요.
자세히 보기각 에이전트가 역할을 나눠 함께 문제를 푼다는 설계예요. 단순 작업은 분산 처리가 빠르지만, 조율 비용도 커요. AutoGen 같은 프레임워크가 이 영역을 다룹니다.
자세히 보기질문에 맞는 문서를 찾아 생성 모델의 입력에 함께 넣는 구조예요. 2020년 RAG 논문은 검색기와 생성기를 결합해 지식 집약 과제를 풀었습니다. 잘못된 문서를 찾으면 답도 틀릴 수 있으므로 검색 결과와 인용을 함께 검증해야 합니다.
자세히 보기모델의 출력을 또 다른 모델로 평가하는 기법이에요. 평가자가 빠르고 일관성이 있어요. 단, 평가자의 편향도 함께 봐야 합니다.
자세히 보기모델은 근거가 약한 질문에 단정적으로 답할 수 있어요. '불확실'을 인식하는 프롬프트와 구조 설계가 필요합니다. 예측 확률을 함께 받는 것도 방법이에요.
자세히 보기