통계적 근거에 기반한 투명한 SAE 특징 조향(steering) 파이프라인을 제안한 연구다. 6개 조건의 신뢰성 필터를 거친 뒤 F-검정, KSG 상호정보량, Cohen's d 세 통계량의 Borda 합의로 희소 특징 순위를 매기고, Cohen's d 가중 SAE 디코더 행 조합으로 최적화가 필요 없는 조향 방향을 구성한다(근사 특징 비상관 하에서 Fisher-LDA로 정당화). Gemma 계열 3개 모델, 4개 행동 도메인, 356개 레이어-강도 구성 실험에서 측정 가능한 도메인 특화 변화를 얻었고, 최고 구성에서는 Gemma 2 9B의 논리 정확성 조향이 +1.16 점수 향상을 기록했다. 그러나 핵심 발견은 사용 가능한 조향이 모델·도메인·레이어·강도에 따라 매우 국소적이며, 원시 행동 변화와 품질 보존 생성 사이에 큰 격차가 있다는 점이다. 조향 평가는 품질 조건부 성공률을 함께 보고해야 한다고 주장한다.
- •F-검정·KSG 상호정보량·Cohen's d의 Borda 합의로 SAE 특징을 선별하는 최적화 불필요 조향 파이프라인
- •Gemma 3개 모델·4개 도메인·356개 레이어-강도 구성으로 광범위 평가
- •최고 구성에서 Gemma 2 9B 논리 정확성 조향 +1.16 달성
- •사용 가능한 조향은 모델·도메인·레이어·강도에 따라 매우 국소적—품질 조건부 평가 보고 필요 주장
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Statistically Grounded Sparse-Feature Interventions for Activation-Space Control in Large Language Models
- 1.통계 기반 SAE 피처 선별로 최적화 없는 활성화 스티어링 파이프라인 제안
- 2.6조건 신뢰성 필터 후 F-검정·KSG 상호정보량·Cohen's d의 Borda 합의로 피처 순위화
- 3.Gemma 2 9B 논리 정확성 스티어링에서 주지표 +1.16 달성
- 4.사용 가능한 스티어링은 모델·도메인·레이어·강도에 고도로 국지화된다는 한계 발견
왜 중요한가?
원시 행동 변화량만 보고하는 기존 스티어링 평가 관행에 대해, 생성 품질을 보존하는 '조건부 성공' 지표를 함께 보고해야 한다는 방법론적 문제를 제기한다. 파인튜닝 없는 경량 행동 제어의 실제 적용 범위가 생각보다 좁다는 실증 결과다.
언급 프로젝트
본문 미리보기
arXiv:2607.19364v1 Announce Type: new Abstract: Activation steering offers a lightweight alternative to fine-tuning for behavioral control of large language models, but SAE-based steering methods often rely on learned steering objectives or single-criterion feature selection. We introduce a transparent SAE-feature steering pipeline that first applies a six-condition reliability filter, then ranks sparse features through an unweighted Borda consensus over three complementary statistics: $F$-test
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

