전체 콘텐츠22

프롬프트개발자

직접 구현한 코드에 대한 리뷰 요청

너는 딥러닝 프레임워크에 정통한 시니어 엔지니어야. 아래 코드는 내가 밑바닥부터 구현해본 {{구현한 대상, 예: 셀프 어텐션 클래스}}야. 1) 텐서 차원이 각 단계에서 어떻게 바뀌는지 줄 단위로 추적해서 알려줘 2) 버그나 비효율적인 부분이 있으면 구체적인 줄 번호와 함께 지적해줘

by AI WIKI 기여자

자세히 보기
프롬프트개발자

미세 튜닝용 데이터셋 포맷 설계 도와주기

나는 LLM을 {{목표 작업, 예: 사내 문서 기반 Q&A}}에 맞게 지시 미세 튜닝하고 싶어. 아래 조건을 참고해서 instruction/input/output 형식의 JSON 데이터 샘플 5개를 만들어줘. 실제 사용 사례를 다양하게 섞어줘. 조건: {{예: 한국어, 답변은 3문장

by AI WIKI 기여자

자세히 보기
오늘의 카드개발자

미래를 보면 안 되는 이유

GPT는 왼쪽에서 오른쪽으로 한 단어씩 글을 씁니다. 만약 훈련 중에 미래 단어를 미리 볼 수 있다면 '커닝'을 하는 셈이라 실전에서는 못 쓰는 모델이 됩니다. 코잘 어텐션은 미래 위치의 점수를 음의 무한대로 가려서 이 커닝 자체를 원천 차단합니다.

자세히 보기
오늘의 카드개발자

숏컷 하나로 깊은 모델이 안 무너지는 이유

층을 아주 깊게 쌓으면 학습 신호(기울기)가 앞쪽까지 전달되다가 사라져버리는 문제가 생깁니다. 숏컷(잔차) 연결은 입력을 몇 개 층 건너뛰어 출력에 그대로 더해주는 지름길을 놔줘서, 신호가 끊기지 않고 끝까지 전달되게 합니다.

자세히 보기
오늘의 카드개발자

LoRA, 가벼운 미세 튜닝의 비결

LLM 전체를 다시 훈련하려면 원본 모델만큼 큰 메모리가 필요합니다. LoRA는 원래 가중치는 그대로 얼려두고, 그 옆에 붙인 아주 작은 저순위 행렬 한 쌍만 학습해서 개인용 GPU로도 미세 튜닝을 가능하게 만든 기법입니다.

자세히 보기