Statistically Grounded Sparse-Feature Interventions for Activation-Space Control in Large Language Models
- 1.통계 기반 SAE 피처 선별로 최적화 없는 활성화 스티어링 파이프라인 제안
- 2.6조건 신뢰성 필터 후 F-검정·KSG 상호정보량·Cohen's d의 Borda 합의로 피처 순위화
- 3.Gemma 2 9B 논리 정확성 스티어링에서 주지표 +1.16 달성
- 4.사용 가능한 스티어링은 모델·도메인·레이어·강도에 고도로 국지화된다는 한계 발견
왜 중요한가?
원시 행동 변화량만 보고하는 기존 스티어링 평가 관행에 대해, 생성 품질을 보존하는 '조건부 성공' 지표를 함께 보고해야 한다는 방법론적 문제를 제기한다. 파인튜닝 없는 경량 행동 제어의 실제 적용 범위가 생각보다 좁다는 실증 결과다.
🏷️ 언급 프로젝트
본문 미리보기
arXiv:2607.19364v1 Announce Type: new Abstract: Activation steering offers a lightweight alternative to fine-tuning for behavioral control of large language models, but SAE-based steering methods often rely on learned steering objectives or single-criterion feature selection. We introduce a transparent SAE-feature steering pipeline that first applies a six-condition reliability filter, then ranks sparse features through an unweighted Borda consensus over three complementary statistics: $F$-test
전체 내용이 궁금하다면?
원문을 직접 읽어보세요