활성화 스티어링은 언어모델의 은닉 활성화에 학습된 방향을 더해 재학습 없이 특정 행동을 바꾸지만, 다른 행동에 의도치 않은 부작용을 일으켜 안전한 배포를 어렵게 만든다. 연구진은 이런 부작용을 사전에 예측할 수 있는지 묻고, 3개 오픈웨이트 모델에서 67개 행동 분류체계에 걸친 교차효과 행렬을 구성했다. 부작용은 흔하고 구조적이며 종종 비대칭적으로 나타나 기존의 유사도 기반 휴리스틱으로는 설명되지 않는 상호작용이 드러났다. 그럼에도 부작용의 크기는 주로 대상 행동에 의해 결정되고, 그 방향은 스티어링 전 모델 표현에서 단순 기준선보다 훨씬 높은 정확도로 예측할 수 있었다. 이는 활성화 스티어링의 부작용이 체계적이고 예측 가능하다는 것을 보여주며, 사전 안전 감사와 보다 신중한 배포를 가능하게 한다.
- •3개 오픈웨이트 모델·67개 행동에 대한 교차효과 행렬로 스티어링 부작용을 체계적으로 분석
- •부작용은 흔하고 비대칭적이며 기존 유사도 기반 휴리스틱으로 설명되지 않는 상호작용 존재
- •부작용 크기는 대상 행동에 좌우되고, 방향은 스티어링 전 표현에서 높은 정확도로 예측 가능
- •예측 가능한 부작용 특성을 활용해 사전 안전 감사와 신중한 배포 지원 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Forecasting Side Effects of Activation Steering
본문 미리보기
arXiv:2608.11227v1 Announce Type: new Abstract: Activation steering modifies a language model by adding a learned direction to its hidden activations, enabling targeted behavioral changes without retraining. While effective, steering often produces unintended side effects on other behaviors, making it difficult to deploy safely. We therefore ask: can these side effects be forecasted before steering is applied? We answer this question by constructing a cross-effect matrix over a taxonomy of 67 b
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

