LISA(Linear-Indexed Sparse Attention)는 긴 사고사슬(CoT) 추론 모델의 어텐션 연산량을 O(n²)에서 O(nM)으로 낮추는 플러그앤플레이 어텐션 대체 모듈로, 처음부터 재학습할 필요가 없다. O(n) 복잡도로 장거리 기억을 담당하는 선형 어텐션과, 전체 컨텍스트에서 중요 토큰 상위 M개를 골라내는 Lightning Indexer를 게이팅으로 융합했다. 교사 모델 증류로 선형 어텐션을 초기화한 뒤 헤드별 KL 발산 손실로 Indexer를 학습하는 2단계 파이프라인을 쓴다. DeepSeek-distilled-Qwen 모델 실험에서 16K 토큰 컨텍스트 기준 추론 속도 50% 향상과 함께 AIME·MATH-500 등 추론 벤치마크 평균 성능 5.6% 개선을 달성해, 긴 CoT 추론의 상용 배포 비용 문제에 실용적 해법을 제시한다.
- •기존 모델에 붙이는 플러그앤플레이 모듈로 어텐션 복잡도를 O(n²)→O(nM)으로 축소, 사전학습 재수행 불필요
- •O(n) 선형 어텐션(장거리 기억)과 상위 M개 토큰을 선별하는 Lightning Indexer를 게이팅으로 병렬 융합
- •1단계 지식 증류로 선형 어텐션 초기화, 2단계 헤드별 KL 발산 손실로 Indexer의 토큰 선택을 교사 모델에 정렬
- •16K 토큰 컨텍스트에서 추론 속도 50% 향상, AIME·MATH-500 등 추론 벤치마크 평균 5.6% 성능 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning
- 1.재사전학습 없이 교체 가능한 플러그인 희소 어텐션 모듈 LISA 제안
- 2.O(n) 선형 어텐션과 상위 M개 토큰을 고르는 Lightning Indexer를 게이팅으로 융합, 복잡도 O(nM)
- 3.교사 모델 어텐션 분포를 증류하는 2단계 학습과 헤드별 KL 손실로 Indexer 정렬
- 4.DeepSeek 증류 Qwen에서 16K 컴텍스트 추론 50% 가속, AIME·MATH-500 평균 +5.6%
왜 중요한가?
긴 사고사슬(CoT) 추론 모델의 O(n²) 어텐션 비용이 프로덕션 배포의 병목인 상황에서, 속도 50% 개선과 벤치마크 성능 향상을 동시에 달성한 점이 핵심이다. 처음부터 재학습이 필요 없는 플러그인 방식이라 기존 추론 모델에 바로 적용할 수 있다.
언급 프로젝트
본문 미리보기
arXiv:2607.19358v1 Announce Type: new Abstract: Recent advances in long chain-of-thought reasoning models such as DeepSeek-R1 have led to increasingly longer inference context lengths under the test-time scaling paradigm. However, the O(n^2) computational complexity of standard self-attention causes inference costs to grow sharply with long sequences, limiting the deployment of long-CoT reasoning in production settings. To address this, we propose LISA (Linear-Indexed Sparse Attention), a plug-
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

