선형 활성화 스티어링은 언어모델 행동을 제어하는 간단하고 효과적인 방법으로 인기를 끌었고, 최근에는 은닉상태의 노름(norm)이 개념 정보를 담지 않는다는 가정 아래 구면(spherical) 스티어링이 제안됐다. 저자들은 통제된 실험으로 각도(angular) 성분과 반경(radial) 성분의 역할을 분리해, 스티어링 기법들이 본질적으로 토큰의 개념 방향 정렬을 바꾸는 효과와 은닉상태 노름을 바꾸는 효과를 어떻게 결합하는지에서 갈린다는 점을 보였다. 7개 언어모델에서 개념은 주로 각도 구조에 표현돼 구면 기법의 동기를 뒷받침했지만, 노름도 스티어링의 안정성과 하위 효과에 중요했다. 따라서 두 효과를 뒤섞는 단일 가산 계수가 아니라 해석 가능한 각도·반경 성분으로 스티어링을 매개변수화해야 한다고 제안한다.
- •스티어링 기법은 토큰의 개념 방향 정렬(각도) 변화와 은닉상태 노름(반경) 변화를 어떻게 결합하느냐에서 갈린다
- •7개 언어모델에서 개념은 주로 각도 구조에 표현되어 구면 스티어링의 동기를 럒받침
- •그러나 노름은 스티어링의 안정성과 하위 태스크 효과에 여전히 중요함
- •유사한 개념 효과를 가진 개입이 서로 다르게 동작하는 이유를 설명
- •단일 가산 계수 대신 해석 가능한 각도·반경 성분으로 스티어링을 매개변수화할 것을 제안
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Geometric Account of Activation Steering through Angle-Norm Decomposition
- 1.선형 활성화 스티어링을 각도·노름 분해 관점에서 재조명한 기하학적 분석
- 2.스티어링 기법들이 각도 정렬과 은닉상태 노름 변화를 결합하는 방식에서 차이남
- 3.7개 언어모델서 개념은 주로 각도 구조에 표현되나 노름은 안정성에 중요함을 발견
- 4.단일 가산 계수 대신 해석가능한 각·반경 성분으로 스티어링 매개변수화 제안
왜 중요한가?
구면 스티어링이 노름은 개념 정보를 담지 않는다고 가정해온 것과 달리, 노름이 스티어링의 안정성·후속 효과에 중요함을 실증해 모델 행동 제어 기법의 설계 원칙을 정교화한 점이 의미 있다.
언어 모델의 행동을 제어하는 활성화 조향 기법을 기하학적 관점에서 분석하는 심층 연구입니다. 국내 AI 연구자들과 개발자들에게는 LLM의 내부 작동 원리를 깊이 이해하고, 더욱 정교하고 안정적인 AI 모델을 구축하기 위한 기초적인 지식과 통찰을 제공할 것입니다.
본문 미리보기
arXiv:2606.06735v1 Announce Type: new Abstract: Linear activation steering has gained popularity as a simple and empirically effective way to control language model behavior. More recently, spherical steering paradigms have been proposed to address limitations of additive interventions, often motivated by the assumption that hidden-state norm does not carry concept-relevant information. In this work, we revisit this assumption through a controlled empirical study designed to disentangle the rol
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:12AI 초안

