PCS(Probabilistic Concept-Aware Steering)는 LLM 추론 시 스티어링 벡터(SV)의 표현 비일관성 문제를 해결하는 프레임워크다. 기존 SV 기법은 긍정-부정 이진 스티어링 평가와 이산 클러스터링 지표에 의존해 의미 정렬의 연속적 스펙트럼을 포착하지 못했고, 그 결과 해석 가능성과 세밀한 제어를 해치는 비일관 동작이 자주 발생했다. PCS는 개념 기반 스티어링 벡터 검색과 확률적 강도 보정을 결합해, 원래 과제 수행 능력을 보존하면서 제어 가능하고 안전 지향적인 의미 편향을 부여한다. 재학습 없이 추론 시점에 LLM 출력을 안전하게 조정하려는 활성화 스티어링 연구의 신뢰성을 높이는 접근이다.
- •기존 스티어링 벡터 기법의 표현 비일관 동작 문제를 지적하고 원인을 이진 평가·이산 지표 의존으로 분석
- •개념 기반 스티어링 벡터 검색과 확률적 강도 보정을 결합한 PCS 프레임워크 제안
- •원래 과제 수행 능력을 보존하면서 안전 지향 의미 편향을 제어 가능하게 부여
- •재학습 없는 추론 시점(inference-time) 개입이라는 점에서 경량 안전 제어 기법으로 활용 가능
Probabilistic Concept-Aware Steering for Trustworthy LLM Inference
본문 미리보기
arXiv:2607.18259v1 Announce Type: new Abstract: Steering vectors (SVs), an inference-time intervention technique for large language models (LLMs), guide the generation process by adding a concept-specific direction vector to intermediate activations during inference. However, existing SV methods frequently yield representation-incoherent behaviors that undermine interpretability and fine-grained control, largely because prior work has focused on binary positive-negative steering evaluation whil
전체 내용이 궁금하다면?
원문을 직접 읽어보세요