LLM의 아첨(sycophancy), 즉 사용자 비위 맞추기를 활성화 조향으로 탐지·제어하기 위한 새로운 데이터 생성 파이프라인을 제안한 연구다(Google DeepMind 계열 저자 포함). 기존의 단순 이진 대조 샘플 쌍을 넘어, 행동 강도에 따라 선형적으로 스케일되는 정도별 샘플을 반복 생성해 행동을 담당하는 '계단식 선형 특징(cascading linear features)'을 분리한다. 이렇게 발견된 아첨 특징은 선형 분리 가능한 부분공간을 형성해 베이스라인보다 목표 행동에 명확히 대응하는 활성화 선택을 가능케 했다. 탐지, 결정론적 점수화, 견고한 조향 평가에서 LLM-as-a-judge와 시스템 프롬프트 베이스라인과 대등하거나 우수하면서 계산 비용은 낮고 해석 가능성 보장은 더 컸다. 코드와 데이터도 공개됐다.
- •이진 대조 쌍 대신 행동 강도가 선형 스케일되는 샘플을 반복 생성하는 파이프라인 제안
- •아첨 특징이 선형 분리 가능한 부분공간을 형성함을 입증
- •탐지·점수화·조향에서 LLM-as-a-judge·시스템 프롬프트 베이스라인과 대등 이상
- •더 낮은 계산 비용과 더 강한 해석 가능성 보장, 코드·데이터 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Detecting and Controlling Sycophancy with Cascading Linear Features
- 1.행동에 선형 비례하는 단계적 샘플로 캐스케이딩 선형 특징을 분리하는 반복 데이터 생성 파이프라인 제안
- 2.단순 이진 대조쌍을 넘어 특징 정도를 스케일링해 더 나은 특징 분리 달성
- 3.아첨(sycophancy) 특징이 선형 분리 가능한 부분공간을 형성함을 입증
- 4.LLM-as-judge·시스템 프롬프트 대비 동등 이상 성능에 낮은 연산 비용
왜 중요한가?
아첨처럼 미묘한 행동을 더 명확히 탐지·조향하기 위한 대조 데이터 구성법을 개선해, 활성화 조향 기반 해석가능성과 모델 제어의 신뢰성을 높인다.
본문 미리보기
arXiv:2606.26155v1 Announce Type: new Abstract: Interpreting and controlling model behaviors through activation steering methods requires many pairs of contrastive samples that clearly exhibit desired or undesired behavior. These data pairs determine the degree to which interpretability frameworks can reliably detect model features responsible for a behavior, and therefore the ability to steer models toward or away from such behavior. In this work, we present an iterative data generation pipeli
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

