다중모달 대형언어모델(MLLM)은 시각 토큰 처리 비용이 커 효율이 제한되며, 기존에는 사전 정의된 중간층의 텍스트-시각 어텐션으로 중요 토큰을 골라 가지치기했다. 하지만 연구진 분석 결과 질문에 가장 민감하게 반응하는 층은 샘플마다 크게 달라 고정된 층 선택은 최적이 아니었고, 적절한 중간층의 어텐션을 얻으려면 이미 여러 언어모델 층을 거치며 상당한 연산을 소모해야 하는 문제도 있었다. 연구진은 원래 질문과 참조 질문의 어텐션을 대조해 샘플별 교사 층을 식별하는 '질문 대조 교사 선택'을 활용한 '중간층 어텐션 예측(MAP)'을 제안했다. 선택된 층의 어텐션을 경량 예측기에 증류해 멀티모달 입력 특징만으로 시각 토큰 중요도를 추정하며, 추론 시 다양성 기준과 결합해 첫 언어모델 층 이전에 토큰을 가지치기한다. LLaVA-NeXT-7B의 10개 벤치마크에서 MAP는 시각 토큰의 5.56%만으로 가지치기 전 성능의 97.5%를 유지하며 종단 간 3.09배 속도 향상을 달성했다.
- •기존 중간층 어텐션 기반 가지치기는 고정된 층을 써서 샘플별 최적 층을 놓쳐다.
- •MAP는 질문 대조로 샘플별 교사 층을 골라 경량 예측기에 증류하는 방식이다.
- •추론 시 언어모델 첫 층 이전에 시각 토큰을 미리 가지치기해 연산을 절감한다.
- •LLaVA-NeXT-7B 10개 벤치마크에서 토큰의 5.56%만으로 성능의 97.5%를 유지했다.
- •종단 간(end-to-end) 3.09배의 속도 향상을 달성했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin
본문 미리보기
arXiv:2608.06411v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) achieve strong performance across diverse vision-language tasks, but their efficiency is limited by the cost of processing numerous visual tokens. Visual token pruning can reduce this cost, but requires accurate token importance estimates. Recent studies have demonstrated that text-to-vision attention from middle language model layers can effectively guide visual token pruning, typically using attention fro
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

