연구진이 언어 에이전트의 선택적 철회 능력을 평가하는 합성 환경 NAQD-Env를 제안했다. 증거 변화, 권한 취소, 중지 지시가 발생했을 때 영향받은 행동만 중단하고 무관한 작업은 보존하며 충분한 복구 후에만 재개하는 것이 이상적 대응이라는 전제 아래, 11개 의존성 체계에 걸쳐 결정론적 기준 정책과 비교해 평가한다. 두 모델군에서 3개의 오픈웨이트 모델을 350개 고정 시나리오, 3150개 모델 프롬프트 에피소드로 테스트한 결과, 철회 재현율은 최대 0.06에 그쳤고 적절한 재개가 관찰된 사례는 전혀 없었으며 완전한 기준 정책과 일치한 에피소드는 단 1건뿐이었다. 지도 미세조정을 적용하면 결정 정확도가 크게 개선됐지만, 부적절한 철회와 이벤트 보고 누락 문제도 함께 드러났다.
- •언어 에이전트의 선택적 철회, 즉 영향받은 행동만 중단하고 무관한 작업은 보존하며 충분한 복구 후 재개하는 능력을 평가하는 합성 환경 NAQD-Env 제안
- •11개 의존성 체계와 350개 고정 시나리오로 3150개 모델 프롬프트 에피소드 평가
- •철회 재현율 최대 0.06, 적절한 재개 사례 없음, 완전한 기준 정책 일치는 1건뿐
- •Qwen2.5-7B는 위험한 시도는 적었지만 유용한 작업 완료와 무관 행동 보존 정확도는 더 낮음
- •지도 미세조정으로 Qwen2.5-3B 결정 정확도가 0.45에서 0.54 수준에서 0.83에서 0.92 수준으로 개선됐지만 부적절한 철회와 보고 누락 부작용도 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NAQD Env: A benchmark for selective withdrawal in language agents
- 1.NAQD-Env 벤치마크 공개, 에이전트의 '선택적 철회'(수행 중단·보존·재개) 능력 측정
- 2.11개 의존성 패밀리·350개 시나리오로 Qwen2.5·Llama-3.1 등 3개 모델 3,150개 에피소드 평가
- 3.철회 재현율(recall) 최대 0.06에 불과, 적격 상황서 올바른 재개(resumption)는 전혀 관찰되지 않음
- 4.미세조정 시 Qwen2.5-3B 정확도 0.45~0.54에서 0.83~0.92로 개선되나 이벤트 보고 누락 등 부작용 발생
왜 중요한가?
증거 변화나 중단 지시에 맞춰 일부 작업만 선택적으로 멈추고 나머지는 보존·재개하는 능력은 실제 배포된 에이전트의 신뢰성에 핵심적인데, 현재 오픈웨이트 모델들이 이 능력에서 거의 0에 가까운 성능을 보인다는 정량적 증거를 제시한다.
본문 미리보기
arXiv:2609.38460v1 Announce Type: new Abstract: Language agents must revise planned actions when evidence changes, permission is revoked, or a stop instruction arrives. A useful response is selective: suspend affected actions, preserve unaffected work, and resume only after sufficient repair. We introduce NAQD-Env, a synthetic environment that evaluates these decisions against a deterministic reference policy over explicit evidence, authorization, and constraint dependencies. Eleven dependency
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

