이 논문은 트랜스포머의 구조적 가지치기를 고정된 평가 예산 안에서 손상 인지형 다중무장밴딧 문제로 정식화한다. 어텐션 헤드와 MLP 채널 그룹을 캘리브레이션 배치에서 일시적으로 마스킹해 마스킹 손실과 기본 손실의 차이인 '페어드 손상'을 측정하고, 이를 보상으로 삼아 UCB 정책이나 분수-베타 톰슨 샘플링으로 순차적으로 최종 마스크를 구성한다. GPT-2, OPT, Pythia, Qwen2.5, ViT-B/16 등 8개 모델에 실험한 결과, 밴딧 기반 방법이 예산 기반 그리디 선택보다 손상을 줄이는 경우가 많았으며 116개 비교 중 23개에서 통계적으로 유의한 개선을 보였다. 비전 트랜스포머의 이득이 단순히 더 큰 평가 예산 때문이 아님을 매칭 평가로 확인했다.
- •구조적 가지치기를 손상 인지형 다중무장밴딧 문제로 재정식화(UCB/토슨 샘플링 활용)
- •8개 언어·비전 트랜스포머 모델에서 그리디 선택 대비 손상 감소 효과를 확인
- •116개 비교 중 23개에서 통계적으로 유의한 개선(부트스트랩 신뢰구간 기준)
- •ViT·Swin 등 비전 모델의 이득이 단순 예산 증가 때문이 아님을 매칭 평가로 검증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Damage-Aware Bandit Pruning for Vision and Language Transformers
- 1.트랜스포머 구조적 프루닝을 손상인지 다중무장밴딧 문제로 정식화한 기법 제안
- 2.어텐션 헤드·MLP 채널그룹을 교정 배치에서 임시 마스킹해 짝지은 손상도를 보상으로 사용
- 3.UCB·분수베타 톰슨샘플링으로 GPT-2·OPT·Pythia·Qwen2.5·ViT 등 8개 모델 실험
- 4.28개 비교 중 23개가 부트스트랩 신뢰구간에서 0을 배제, 예산 증가만으로는 설명 안되는 성능 우위 확인
왜 중요한가?
포스트 트레이닝 프루닝에서 어떤 구조 단위를 제거할지 결정하는 데 밴딧 기반 탐색을 적용해 무작위·크기기반 방식보다 안정적으로 손상을 줄이는 실용적 방법론을 제시한다.
본문 미리보기
arXiv:2609.05448v1 Announce Type: new Abstract: Structured post-training pruning of transformers requires selecting complete functional units whose suppression causes limited degradation. We formulate structured-unit selection for language and vision transformers as a damage-aware multi-armed bandit problem under a fixed candidate-evaluation budget. Attention heads and MLP channel groups are temporarily masked on calibration batches. Paired damage is the masked loss minus the base loss on the s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

