현재 에이전트 평가는 완전히 명세된 과제 수행만 보상하며, 명료화·역량 인식·기권·검색 종료 같은 분기 결정은 분리되어 연구돼 왔다. 저자들은 같은 기본 요청을 Complete(ANSWER), Clarifiable(CLARIFY), Support-Blocked(REQUEST SUPPORT), Unsupported-Now(ABSTAIN) 네 가지 지원 상태로 최소 반사실 편집해 매칭한 SSTA-32 진단 프레임워크를 제안했다. 프론티어 모델을 Direct·Action-Only·Confidence-Only·Preflight Support Check(PSC) 네 프롬프트 조건에서 평가한 결과 기본 실행은 41.7%의 과잉 약속률을 보였고 스칼라 신뢰도 매핑은 과잉 약속을 피하지만 3분류 유예 정확도가 58.3%에 그쳤다. 반면 Action-Only와 PSC는 91.7% 유예 정확도를 달성해, 명시적 범주형 결정 경로가 잠재적 분기 능력을 안전하게 활성화함을 보였다.
- •4가지 지원 상태를 반사실로 세운 진단 벤치마크 SSTA-32 제안
- •기본 실행은 비완전 과제에 대해 41.7% 과잉 약속 고비댔
- •스칼라 신뢰도는 과잉 약속을 피하나 3분류 유예 정확도 붕괴
- •Action-Only·PSC 프롬프트가 91.7% 유예 정확도 달성
- •명시적 범주 결정 경로가 잠재적 분기 능력을 안전하게 활성화
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Don't Start What You Can't Finish: A Counterfactual Audit of Support-State Triage in LLM Agents
본문 미리보기
arXiv:2604.16752v1 Announce Type: new Abstract: Current agent evaluations largely reward execution on fully specified tasks, while recent work studies clarification [11, 22, 2], capability awareness [9, 1], abstention [8, 14], and search termination [20, 5] mostly in isolation. This leaves open whether agents can diagnose why a task is blocked before acting. We introduce the Support-State Triage Audit (SSTA-32), a matched-item diagnostic framework in which minimal counterfactual edits flip the
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

