Vision Transformer용 무학습 토큰 감축 기법(ToMe·ToFu·PiToMe·MCTF)이 서로 다른 점수 메커니즘을 쓰면서도 고압축 영역에서 비슷한 절벽형 붕괴를 보이는 이유를 진단한 연구다. 저자들은 순위 일관성 ρ_s와 비대각 상관 ρ_off라는 두 도구를 제안해 붕괴를 (1) 층별 감축에 내재된 신호 비의존적 오차 증폭기와 (2) 깊은 층에서 ρ_s가 0.88에서 0.27로 떨어지는 쌍별 유사성 신호 의존이라는 두 요인으로 분해했다. 단항 신호는 O(N_p) 섭동으로 안정적인 반면 쌍별 순위는 O(N_p²) 결합 섭동으로 본질적으로 불안정하다. 진단에서 도출한 세 설계 원칙을 적용해 만든 CATIS는 ViT-Large 63% FLOPs 감축에서 ImageNet-1K 정확도의 96.9%를 유지해 다른 기법들의 43-65% 붕괴와 대조됐다.
- •무학습 토큰 감축 기법들의 고압축 붕괴 원인을 일관되게 설명
- •순위 일관성 ρ_s·비대각 상관 ρ_off 이용한 진단 프레임워크 제시
- •쪽별 유사성 신호의 구조적 불안정성을 이론·실험으로 입증
- •단항 신호가 쪽별 신호보다 구조적으로 안정적
- •CATIS가 ViT-Large 63% FLOPs 감축 시 정확도 96.9% 유지로 기존 기법 대폭 능가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals
본문 미리보기
arXiv:2604.16745v1 Announce Type: new Abstract: Training-free token reduction methods for Vision Transformers (ToMe, ToFu, PiToMe, and MCTF) employ different scoring mechanisms, yet they share a closely matched cliff-like collapse at high compression. This paper explains \emph{why}. We develop a diagnostic framework with two tools, ranking consistency $\rho_s$ and off-diagonal correlation $\rho_\text{off}$, that decomposes the collapse into (1)a signal-agnostic error amplifier inherent to layer
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

