FlashAttention, 메모리를 절약하는 어텐션
2022년 제안된 기법으로 어텐션 계산을 블록 단위로 나눠 메모리를 줄여요. 2023년 FlashAttention-2가 더 효율적인 버전을 냈어요. 대규모 모델 추론의 표준이 됐습니다.
- 01
2022년 제안된 기법으로 어텐션 계산을 블록 단위로 나눠 메모리를 줄여요. 2023년 FlashAttention-2가 더 효율적인 버전을 냈어요. 대규모 모델 추론의 표준이 됐습니다.
2022년 제안된 기법으로 어텐션 계산을 블록 단위로 나눠 메모리를 줄여요. 2023년 FlashAttention-2가 더 효율적인 버전을 냈어요. 대규모 모델 추론의 표준이 됐습니다.
2022년 제안된 기법으로 어텐션 계산을 블록 단위로 나눠 메모리를 줄여요. 2023년 FlashAttention-2가 더 효율적인 버전을 냈어요. 대규모 모델 추론의 표준이 됐습니다.