AdaRoPE는 어텐션 헤드마다 학습 가능한 회전 주파수와 어텐션 스케일링 계수를 부여하는 RoPE 개선안이다. 표준 RoPE가 모든 헤드에 균일한 주파수 스케줄과 스케일링을 강제하는 반면, 검색 태스크와 길이 일반화 시나리오를 통해 기능적 역할이 다른 헤드는 서로 다른 주파수 범위와 스케일링이 필요함을 실증적·이론적으로 보였다. 이 구조를 무시하면 임베딩 차원 활용이 비효율적이고 특히 장문맥에서 성능이 저하된다. AdaRoPE로 사전학습한 LLM은 partial RoPE, NoPE 등 기존 변형을 일관되게 능가했으며, YaRN 같은 균일 스케일링 기반 컨텍스트 확장법도 최적이 아님을 보이고 헤드별 스케일링으로 단문맥 성능을 보존하면서 더 나은 컨텍스트 확장을 달성했다. 위치 임베딩 최적화를 헤드 수준에서 해야 한다는 설계 원칙을 제시한다.
- •헤드별 학습 가능 회전 주파수·어텐션 스케일링을 도입한 AdaRoPE 제안
- •기능적 역할이 다른 헤드는 서로 다른 주파수 범위가 필요함을 실증·이론 양면으로 규명
- •사전학습 시 partial RoPE·NoPE 등 기존 변형 일관 상회
- •YaRN의 균일 스케일링은 차선—헤드별 스케일링이 컬텍스트 확장과 단문맥 성능 보존을 동시 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally
- 1.어텐션 헤드별 학습형 회전 주파수·스케일링을 부여하는 AdaRoPE 제안
- 2.기능적 역할이 다른 헤드는 서로 다른 주파수 대역이 필요함을 이론·실험으로 입증
- 3.사전학습 시 partial RoPE·NoPE 등 기존 변형을 일관되게 능가
- 4.YaRN류 균일 스케일링이 컰텍스트 확장에 차선임을 보이며 단문맥 성능도 보존
왜 중요한가?
RoPE의 균일 주파수 스케줄이라는 표준 관행 자체를 헤드 단위로 재설계해, 긴 컨텍스트 확장에서 짧은 문맥 성능 희생 없이 개선을 얻었다. YaRN 등 널리 쓰이는 컨텍스트 확장 기법의 균일 스케일링 가정이 차선이라는 지적은 장문맥 모델 설계에 직접적 시사점을 준다.
본문 미리보기
arXiv:2607.19363v1 Announce Type: new Abstract: Rotary Position Embedding (RoPE) is widely adopted in Transformers to encode positional information, yet standard implementations enforce a uniform frequency schedule and scaling across all attention heads. Using simplified retrieval tasks and length generalization scenarios, we show -- both empirically and theoretically -- that heads with different functional roles require distinct frequency ranges and attention scaling factors to operate effecti
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

