전체 콘텐츠50개

오늘의 카드개발자

미래를 보면 안 되는 이유

GPT는 왼쪽에서 오른쪽으로 한 단어씩 글을 씁니다. 만약 훈련 중에 미래 단어를 미리 볼 수 있다면 '커닝'을 하는 셈이라 실전에서는 못 쓰는 모델이 됩니다. 코잘 어텐션은 미래 위치의 점수를 음의 무한대로 가려서 이 커닝 자체를 원천 차단합니다.

자세히 보기
오늘의 카드개발자

숏컷 하나로 깊은 모델이 안 무너지는 이유

층을 아주 깊게 쌓으면 학습 신호(기울기)가 앞쪽까지 전달되다가 사라져버리는 문제가 생깁니다. 숏컷(잔차) 연결은 입력을 몇 개 층 건너뛰어 출력에 그대로 더해주는 지름길을 놔줘서, 신호가 끊기지 않고 끝까지 전달되게 합니다.

자세히 보기
오늘의 카드개발자

LoRA, 가벼운 미세 튜닝의 비결

LLM 전체를 다시 훈련하려면 원본 모델만큼 큰 메모리가 필요합니다. LoRA는 원래 가중치는 그대로 얼려두고, 그 옆에 붙인 아주 작은 저순위 행렬 한 쌍만 학습해서 개인용 GPU로도 미세 튜닝을 가능하게 만든 기법입니다.

자세히 보기
오늘의 카드개발자

온도 스케일링, 확률의 보정값

출력 확률의 기울기를 맞춰 신뢰도를 높이는 기법이에요. 분류 모델의 확률이 실제로 맞는지 판단할 때 필요합니다. 추측 확정이 중요한 과제를 위해 존재합니다.

자세히 보기
오늘의 카드개발자

추론 지연, 왜 중요한가

첫 토큰까지의 시간이 사용자 경험을 결정합니다. 전체 처리 시간보다 이 지연이 중요해요. 서버 측 큐잉과 배치 전략이 이 지연을 좌우합니다.

자세히 보기
오늘의 카드개발자

추측적 해독, 빠른 모델이 먼저 써요

작고 빠른 모델이 여러 후보 토큰을 만들고 큰 모델이 한꺼번에 검증합니다. 검증된 토큰만 채택하므로 큰 모델의 출력 분포를 유지할 수 있어요. 초안 모델과 하드웨어 조건이 맞으면 생성 지연을 줄일 수 있습니다.

자세히 보기
오늘의 카드개발자

GPTQ, 4비트 양자화 도구

2022년 공개된 학습 후 양자화 기법이에요. 가중치를 3비트나 4비트 등으로 줄여 메모리 사용량을 낮춥니다. 정확도 손실은 모델과 설정마다 달라서 실제 작업으로 평가해야 합니다.

자세히 보기
오늘의 카드개발자

배치 크기, 왜 중요한가

한 번에 몇 개의 데이터로 모델을 업데이트할지를 정합니다. 크면 기울기가 안정적이지만 메모리가 커요. GPU 메모리에 맞는 크기를 찾아야 합니다.

자세히 보기
오늘의 카드개발자

체크포인트, 훈련을 멈추고 다시 시작하기

일정 간격으로 모델과 옵티마이저 상태를 저장하면 중단 뒤에도 훈련을 이어갈 수 있어요. 긴 훈련에서 장애 복구와 모델 비교에 중요합니다. 완전한 재현이 필요하면 난수 상태와 데이터 순서도 함께 저장해야 합니다.

자세히 보기
오늘의 카드개발자

ONNX, 모델 형식의 표준

여러 프레임워크에서 모델 포맷을 공유하는 표준이에요. PyTorch, TensorFlow에서 변환하면 다른 엔진에서 돌릴 수 있어요. 추론 최적화의 출발점이 됩니다.

자세히 보기
오늘의 카드개발자

Adam, 표준 최적화 알고리즘

2014년 공개된 Adam은 학습률을 파라미터별로 조절하는 최적화 알고리즘입니다. 기울기의 일차·이차 모멘트 추정치를 함께 사용해요. 여러 딥러닝 작업에서 널리 쓰이지만 항상 최선인 것은 아닙니다.

자세히 보기
오늘의 카드개발자

AWQ, 양자화 방법

2023년 공개된 기법이에요. 주요 가중치를 보호하면서 4비트로 압축합니다. GPTQ와 함께 오픈소스 모델 양자화의 표준이 됐어요.

자세히 보기
오늘의 카드개발자

온도 스케일링, 확률의 보정값

출력 확률의 기울기를 맞춰 신뢰도를 높이는 기법이에요. 분류 모델의 확률이 실제로 맞는지 판단할 때 필요합니다. 추측 확정이 중요한 과제를 위해 존재합니다.

자세히 보기
오늘의 카드개발자

추론 지연, 왜 중요한가

첫 토큰까지의 시간이 사용자 경험을 결정합니다. 전체 처리 시간보다 이 지연이 중요해요. 서버 측 큐잉과 배치 전략이 이 지연을 좌우합니다.

자세히 보기
오늘의 카드개발자

추측적 해독, 빠른 모델이 먼저 써요

작고 빠른 모델이 여러 후보 토큰을 만들고 큰 모델이 한꺼번에 검증합니다. 검증된 토큰만 채택하므로 큰 모델의 출력 분포를 유지할 수 있어요. 초안 모델과 하드웨어 조건이 맞으면 생성 지연을 줄일 수 있습니다.

자세히 보기
오늘의 카드개발자

GPTQ, 4비트 양자화 도구

2022년 공개된 학습 후 양자화 기법이에요. 가중치를 3비트나 4비트 등으로 줄여 메모리 사용량을 낮춥니다. 정확도 손실은 모델과 설정마다 달라서 실제 작업으로 평가해야 합니다.

자세히 보기