프롬프트 엔지니어링이나 파인튜닝 대신 모델 내부 잠재 특성에 직접 개입해 LLM의 OCEAN 성격 특성을 조종하는 기계적 해석가능성(mechanistic interpretability) 접근을 제안한 연구다. 희소 오토인코더(SAE)와 대조 활성화 분석으로 잔차 스트림에서 목표 성격 특성에 대응하는 잠재 방향을 식별하고, 은닉 상태에 작은 가산 스티어링 벡터를 더해 언어 모델링 성능을 유지하면서 목표 특성을 강화한다. 성격 표현과 과제 성능의 균형을 맞추기 위해 그리드 서치 기반 선형 가중 휴리스틱으로 최적의 특성 이동 조합을 탐색했다. 표준 벤치마크 성능을 유지하면서 기계적 수준에서 성격을 제어할 수 있음을 보여, 페르소나 제어와 AI 안전 연구에 활용 가능한 방법을 제시한다.
- •프롬프트·파인튜닝이 아닌 잠재 특성 개입으로 LLM의 OCEAN 성격 조종
- •희소 오토인코더(SAE)와 대조 활성화 분석으로 잔차 스트림의 성격 방향 식별
- •가산 스티어링 벡터로 언어 모델링 성능 유지하며 목표 특성 강화
- •그리드 서치 기반 선형 가중 휴리스틱으로 성격 표현과 과제 성능 균형 최적화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions
- 1.프롬프트·파인튜닝 대신 잠재 특징 개입으로 LLM의 OCEAN 성격을 조정하는 기계적 해석 접근
- 2.희소 오토인코더(SAE)와 대조 활성화 분석으로 잔차 스트림 내 성격 방향 식별
- 3.은닉 상태에 작은 가산 이동만으로 목표 성격을 강화하면서 언어 모델링 성능 유지
- 4.그리드 탐색 기반 선형 가중 휴리스틱으로 성격 발현과 과제 성능의 균형점 탐색
왜 중요한가?
성격 제어를 프롬프트 수준이 아니라 활성화 공간의 스티어링 벡터로 내리면, 페르소나가 대화 중 무너지는 문제를 구조적으로 피할 수 있다. SAE 기반 해석 가능성 연구를 실용적 제어 수단으로 연결한 사례로, 캐릭터 AI·브랜드 톤 유지 제품에 응용 여지가 있다.
본문 미리보기
arXiv:2606.28770v1 Announce Type: new Abstract: Large Language Models (LLMs) have demonstrated the ability to simulate human-like OCEAN personality traits in generated text. Previous efforts have focused on prompt engineering or fine-tuning to shape LLM personality. In this work, we propose a mechanistic interpretability approach that directly intervenes on the model's latent features. Our method identifies latent directions in the residual stream corresponding to a target OCEAN trait using spa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

