이 연구는 AI 컴패니언이 반복적인 사회적 상호작용을 오래 매개할 때 나타나는 두 가지 장기 실패, 즉 배치된 역할·경계·가치·스타일을 잃는 '페르소나 붕괴'와 이런 속성이 점진적으로 침식되는 '행동 표류'를 다룬다. 연구진은 페르소나 유지와 궤적 회상을 별도로 측정하는 통제된 합성 감사 ANCHOR를 도입해, 27개 페르소나·9가지 상호작용 일정·3가지 생성 메모리 설정·4개 평가 모델에 걸쳐 2008건의 대화를 구축했다. 정체성 프로브는 봉인된 102문항 설문과 턴 단위 판정을 결합하고, 궤적 프로브는 35개 대화 뱅크에서 추출한 110개의 보정된 반사실 질문으로 채점한다. 평가된 어떤 모델과 설정도 두 차원 중 어느 하나도 신뢰성 있게 보존하지 못했으며, 궤적 정확도는 평균 44.4%에 그치고 사용자 상태 회상은 4지선다 무작위 수준에 근접했으며, 테스트한 어떤 맥락 조건이나 메모리도 이 실패를 일관되게 해결하지 못했다. 이는 현재 시스템이 장기적인 컴패니언 연속성을 신뢰성 있게 지원하지 못한다는 점을 보여준다.
- •AI 컴패니언의 장기 실패인 '페르소나 붕괴'와 '행동 표류'를 별도로 측정하는 감사 ANCHOR를 도입했다.
- •27개 페르소나·9개 상호작용 일정·4개 모델로 2008건 대화, 정체성·굤적 두 프로브로 평가했다.
- •굤적 정확도는 평균 44.4%에 그치고 사용자 상태 회상은 무작위 수준에 근접했다.
- •테스트한 어떤 메모리·맥락 조건도 페르소나 붕괴와 행동 표류를 일관되게 해결하지 못했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions
본문 미리보기
arXiv:2607.28818v1 Announce Type: new Abstract: As AI companions increasingly mediate repeated social interaction, users may rely on a stable role and shared history, yet locally acceptable replies do not ensure that either persists. We study two observable long-horizon failures: 'persona collapse', the loss of a deployed role, boundaries, values, or style, and 'behavioral drift', the gradual or recurrent erosion of those properties. We introduce ANCHOR, a controlled synthetic audit that separa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

