다중 턴 대화에서 사용자가 이전에 건 제약을 철회해도 모델이 계속 그 요구사항을 따르는 '행동적 재발(revocation inertia)' 현상을 이 논문은 측정·예측·수리 가능한 문제로 다룬다. 모든 제약을 실행 가능한 검사기와 짝지어 철회를 '묘비(tombstone)'로 기록하는 계약 원장을 두고, 순차 절제 프로브로 조항별 준수도를 측정하며, 토큰·시도 예산이 동일한 조건에서 수리 사다리를 적용한다. HumanEval 기반 실험에서 80억 파라미터급 모델은 제약이 늘수록 재발률이 크게 치솟은 반면 강한 모델은 바닥 수준을 유지했고, 사전 컴파일 방식이 원장 없는 검증-재시도 기준선보다 재발을 유의하게 줄였다. 한 문장짜리 묘비 메모만으로도 컴파일 효과의 약 3분의 1을 회복해, 철회 실패를 대화 상태의 측정·수리 가능한 속성으로 전환한다.
- •철회된 제약을 모델이 계속 따르는 '행동적 재발' 현상을 정의하고 측정
- •계약 원장이 철회를 'tombstone'으로 기록해 사전에 순생 제약을 컴파일
- •8B 머심은 제약이 늘을수록 재발률 급증, 강력 모델은 바닥 수준 유지
- •사전 컴파일이 원장 없는 검증-재시도 기준선보다 재발을 유의미하게 감소
- •한 문장짜리 tombstone 메모만으로도 컴파일 효과의 약 1/3을 회복
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues
- 1.다회차 대화에서 철회된 제약을 모델이 계속 따르는 '행동적 재발' 현상을 정량화하는 새 프레임워크 제시
- 2.계약 원장과 사전 컴파일된 순수 제약 상태로 8B급 모델의 재발률을 검증 없는 베이스라인 대비 유의하게 감소
- 3.HumanEval 기반 벤치마크에서 제약 부하가 커질수록 재발률 급증하지만 강한 모델은 낮은 수준 유지
- 4.사전 예측 프로브가 배포 전에 재발 여부를 예측 가능함을 입증(AUROC 기반)
왜 중요한가?
멀티턴 대화에서 사용자가 취소한 제약을 모델이 계속 지키는 문제는 실제 서비스 챗봇이 철회된 지시를 무시하고 과거 규칙을 반복 적용하는 오류로 이어질 수 있어, 에이전트형 LLM의 신뢰성 확보에 실질적 해법을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.12599v1 Announce Type: new Abstract: Multi-turn dialogues let users revoke constraints as easily as impose them, but revocation does not reliably take effect: models keep enacting withdrawn requirements (occasionally beneath comments asserting their removal), a failure we call \emph{behavioral relapse}, or revocation inertia. No existing instrument measures this influence per clause, predicts it before delivery, or repairs it under matched budgets. \sysname{} closes the three gaps th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:21AI 초안

