AI 에이전트
도구를 사용해 목표를 수행하는 시스템
자세히 보기SEARCH THE WIKI
용어, 오늘의 카드, 검증된 프롬프트를 한 번에 찾아보세요.
전체 콘텐츠75개
도구를 사용해 목표를 수행하는 시스템
자세히 보기출력을 만들 때 입력의 어느 부분이 중요한지 가중치로 계산하는 방법
자세히 보기이전에 만든 출력을 다시 입력으로 사용해 다음 출력을 예측하는 모델
자세히 보기문장 안의 빈칸을 채우도록 훈련되어 분류·이해 작업에 강한 트랜스포머 모델
자세히 보기자주 등장하는 글자 조합을 점진적으로 합쳐 어휘를 만드는 토큰화 기법
자세히 보기미래 토큰을 미리 참조하지 못하게 마스킹하는 어텐션 방식
자세히 보기모델이 한 번에 참조 가능한 범위
자세히 보기모델이 예측한 확률과 실제 정답 사이의 차이를 측정하는 손실 함수
자세히 보기훈련 중 은닉층의 일부 유닛을 임의로 꺼서 과대적합을 막는 정규화 기법
자세히 보기단어나 토큰 같은 이산적인 데이터를 연속적인 숫자 벡터로 바꾸는 방법
자세히 보기명시적으로 훈련받지 않았는데도 모델 규모가 커지면서 저절로 나타나는 능력
자세히 보기입력을 이해하는 부분과 출력을 생성하는 부분을 나눈 신경망 구조
자세히 보기트랜스포머 블록 안에서 각 토큰을 독립적으로 변환하는 완전 연결 층
자세히 보기몇 개 예시로 태스크 유도
자세히 보기사전 훈련된 모델을 레이블이 있는 작은 데이터셋으로 추가 학습시키는 것
자세히 보기사전 훈련만 마치고 아직 특정 작업에 특화되지 않은 범용 모델
자세히 보기모델이 외부 함수를 호출하는 기능
자세히 보기트랜스포머의 디코더 부분만 사용해 한 번에 한 단어씩 텍스트를 생성하는 모델
자세히 보기모델이 사실이 아닌 내용을 생성
자세히 보기각 층의 출력값 분포를 평균 0, 분산 1 근처로 맞춰 훈련을 안정시키는 기법
자세히 보기대량의 텍스트로 훈련되어 사람의 언어를 이해·생성하는 신경망 모델
자세히 보기원본 가중치는 그대로 두고 작은 저순위 행렬만 추가로 학습하는 효율적인 미세 튜닝 기법
자세히 보기여러 개의 어텐션을 병렬로 두어 서로 다른 종류의 관계를 동시에 포착
자세히 보기토큰의 순서 정보를 임베딩에 더해주는 방법
자세히 보기레이블 없는 대량의 텍스트에서 다음 단어 예측으로 모델을 훈련하는 첫 단계
자세히 보기모델 입력을 설계하는 기술
자세히 보기외부 지식 검색과 텍스트 생성을 결합해 최신·근거 있는 답을 만드는 방법
자세히 보기이전 단계의 출력을 다음 단계의 입력으로 사용하는, 트랜스포머 이전의 순차 처리 신경망
자세히 보기문장 안의 각 단어가 같은 문장의 다른 단어들과 관계를 계산하는 어텐션
자세히 보기층의 입력을 출력에 그대로 더해 깊은 신경망의 기울기 소실을 완화하는 기법
자세히 보기모델의 기본 행동을 정의하는 지시문
자세히 보기출력의 무작위성 조절 파라미터
자세히 보기텍스트 생성 시 다양성과 일관성 사이의 균형을 조절하는 방법
자세히 보기텍스트를 쪼갠 최소 단위
자세히 보기텍스트를 모델이 다룰 수 있는 단위(토큰)로 쪼개는 전처리 과정
자세히 보기확률이 가장 높은 k개의 후보 안에서만 다음 단어를 무작위로 고르는 방법
자세히 보기어텐션 메커니즘만으로 문장 전체를 한 번에 처리하는 신경망 구조
자세히 보기임베딩을 저장·검색하는 데이터베이스
자세히 보기예시 없이 태스크 수행
자세히 보기예시 없이(제로샷), 또는 아주 적은 예시만으로(퓨샷) 새 작업을 수행하는 능력
자세히 보기다음 문장에서 굵게 표시한 단어를 생성할 때, 셀프 어텐션이라면 어떤 이전 단어들에 가장 높은 가중치를 줄지 추론해줘. 각 후보 단어마다 이유를 한 줄로 설명하고, 가중치가 높은 순서대로 정렬해줘. 문장: {{문장을 넣고 굵게 표시할 단어를 **단어** 형식으로 표시}}
자세히 보기다음 버그 설명으로 재현 단계를 단계별로 작성해줘: {{bug}}
자세히 보기너는 딥러닝 프레임워크에 정통한 시니어 엔지니어야. 아래 코드는 내가 밑바닥부터 구현해본 {{구현한 대상, 예: 셀프 어텐션 클래스}}야. 1) 텐서 차원이 각 단계에서 어떻게 바뀌는지 줄 단위로 추적해서 알려줘 2) 버그나 비효율적인 부분이 있으면 구체적인 줄 번호와 함께 지적해줘
자세히 보기다음 코드를 보안·성능·가독성 관점에서 리뷰해줘: {{code}}
자세히 보기너는 AI/LLM 강의의 출제자야. 아래 개념들을 바탕으로 객관식 문제 5개를 만들어줘. 각 문제는 보기 4개(정답 1개 포함)로 구성하고, 마지막에 정답과 함께 왜 다른 보기가 틀렸는지 한 줄씩 설명해줘. 개념 목록: {{예: 토큰화, BPE, 임베딩, 위치 인코딩}}
자세히 보기{{topic}}을(를) 5살 아이도 이해하게 설명해줘.
자세히 보기나는 LLM을 {{목표 작업, 예: 사내 문서 기반 Q&A}}에 맞게 지시 미세 튜닝하고 싶어. 아래 조건을 참고해서 instruction/input/output 형식의 JSON 데이터 샘플 5개를 만들어줘. 실제 사용 사례를 다양하게 섞어줘. 조건: {{예: 한국어, 답변은 3문장
자세히 보기다음 상황에 맞는 temperature와 top-k 값을 추천하고, 왜 그 값이 적절한지 근거를 설명해줘. 그리고 반대로 너무 극단적인 값을 썼을 때 어떤 문제가 생길지도 한 문장씩 알려줘. 상황: {{예: 법률 문서 요약처럼 정확성이 중요한 작업}}
자세히 보기{{role}} 직군 면접 질문 5개를 난이도별로 만들어줘.
자세히 보기너는 AI를 처음 배우는 사람에게 어려운 개념을 쉬운 비유로 설명하는 선생님이야. 아래 개념을 중학생도 이해할 수 있게 일상적인 비유를 들어 3문단 이내로 설명해줘. 전문 용어를 쓸 때는 반드시 괄호 안에 원어를 병기해줘. 개념: {{설명할 개념, 예: 셀프 어텐션}}
자세히 보기아래 모델 구조를 입력부터 출력까지 순서대로, 텍스트 박스와 화살표(→)만 사용한 다이어그램으로 그려줘. 각 블록 옆에는 입력/출력 텐서의 대략적인 크기도 함께 적어줘. 모델: {{예: GPT-2 small, 트랜스포머 블록 12개}}
자세히 보기너는 AI 연구 논문을 실무 개발자에게 통역해주는 역할이야. 아래 논문(또는 논문 링크/초록)을 다음 형식으로 요약해줘. 1. 한 문장 요약 2. 이 논문이 푼 문제 (기존 방식의 한계 포함) 3. 핵심 아이디어 (수식 없이 개념으로) 4. 실제로 내 프로젝트에 적용한다면 어떤 부분에
자세히 보기다음 요구사항을 만족하는 정규식을 만들어줘: {{requirement}}
자세히 보기다음 문장을 격식체로 다시 써줘: {{text}}
자세히 보기다음 요청을 SQL 쿼리로 변환해줘: {{question}} (스키마: {{schema}})
자세히 보기다음 기사를 3문장으로 요약해줘: {{article}}
자세히 보기다음 텍스트를 {{lang}}로, 원래 톤을 유지해서 번역해줘: {{text}}
자세히 보기다음 함수에 대한 유닛 테스트를 작성해줘: {{function}}
자세히 보기오늘의 카드: LLM 기본 개념을 익혀봅니다.
자세히 보기텍스트가 토큰으로 어떻게 쪼개지는지 살펴봅니다.
자세히 보기임베딩으로 의미적 유사도를 계산하는 원리.
자세히 보기검색 증강 생성이 동작하는 흐름.
자세히 보기프롬프트 엔지니어링 기본 원칙.
자세히 보기창의성과 일관성 사이 균형 잡기.
자세히 보기도구를 호출하는 에이전트의 기본 구조.
자세히 보기LLM은 '다음 단어가 뭘까'라는 단순한 게임을 수십억 번 반복해서 훈련됩니다. 정답 레이블을 따로 만들 필요 없이 텍스트 자체가 정답이 되는 자기 지도 학습이라, 인터넷 규모의 데이터를 그대로 훈련에 쓸 수 있는 것이 핵심입니다.
자세히 보기셀프 어텐션은 토큰마다 쿼리(내가 찾는 것), 키(내가 가진 것), 값(실제 내용) 세 벡터를 만듭니다. 쿼리와 키를 비교해 '얼마나 관련 있는지'를 구하고, 그 비율만큼 값을 섞어서 문맥이 반영된 새 표현을 만드는 것이 전체 과정입니다.
자세히 보기GPT는 왼쪽에서 오른쪽으로 한 단어씩 글을 씁니다. 만약 훈련 중에 미래 단어를 미리 볼 수 있다면 '커닝'을 하는 셈이라 실전에서는 못 쓰는 모델이 됩니다. 코잘 어텐션은 미래 위치의 점수를 음의 무한대로 가려서 이 커닝 자체를 원천 차단합니다.
자세히 보기일반 사전식 토크나이저는 처음 보는 단어를 만나면 <unk> 같은 대체 토큰으로 뭉개버립니다. BPE는 단어를 더 작은 조각(부분단어)이나 심지어 알파벳 한 글자까지 쪼갤 수 있어서, 사실상 모든 단어를 어떻게든 표현할 수 있습니다.
자세히 보기컴퓨터는 '고양이'라는 글자를 이해하지 못해도, [0.2, -1.3, 0.7...] 같은 숫자 벡터는 계산할 수 있습니다. 임베딩은 바로 이 변환을 담당하며, 훈련이 진행될수록 의미가 비슷한 단어의 벡터가 서로 가까워지도록 조정됩니다.
자세히 보기층을 아주 깊게 쌓으면 학습 신호(기울기)가 앞쪽까지 전달되다가 사라져버리는 문제가 생깁니다. 숏컷(잔차) 연결은 입력을 몇 개 층 건너뛰어 출력에 그대로 더해주는 지름길을 놔줘서, 신호가 끊기지 않고 끝까지 전달되게 합니다.
자세히 보기생성 온도를 낮추면 모델은 가장 확률 높은 단어만 고르는 안전한 선택을 반복합니다. 온도를 올리면 확률이 낮은 단어도 뽑힐 기회가 생겨 표현이 다채로워지지만, 너무 높이면 문법이 무너지거나 엉뚱한 문장이 나올 수 있습니다.
자세히 보기분류 미세튜닝은 '스팸이다/아니다'처럼 정해진 몇 개의 답 중 하나만 고르도록 특화 훈련합니다. 지시 미세튜닝은 반대로 훨씬 폭넓은 지시문을 이해하고 자유롭게 응답하도록 훈련해서, 하나의 모델로 번역·요약·질의응답 등 다양한 작업을 처리하게 만듭니다.
자세히 보기가장 작은 GPT-2는 파라미터 1억 2,400만 개, 어텐션 헤드 12개, 임베딩 768차원입니다. 가장 큰 버전은 파라미터 15억 5,800만 개로 10배가 넘죠. 놀랍게도 핵심 구조는 완전히 동일하고, 반복되는 트랜스포머 블록 개수와 임베딩 차원만 다릅니다.
자세히 보기LLM 전체를 다시 훈련하려면 원본 모델만큼 큰 메모리가 필요합니다. LoRA는 원래 가중치는 그대로 얼려두고, 그 옆에 붙인 아주 작은 저순위 행렬 한 쌍만 학습해서 개인용 GPU로도 미세 튜닝을 가능하게 만든 기법입니다.
자세히 보기