이 논문은 GUI(그래픽 사용자 인터페이스) 에이전트가 실행 불가능하거나 모순된 자연어 지시를 받았을 때 이를 인지하고 행동을 멈출 수 있는지를 다루며, 지시 내부 모순과 지시-화면 맥락 모순을 다루는 벤치마크 CONFLICTGUI를 제안한다. 평가 결과 실현 가능한 작업에서는 잘 작동하는 에이전트들이 모순된 지시에서도 맹목적으로 실행을 계속하는 '실행 편향 과잉순응' 현상이 심각하게 나타났다. 이를 완화하기 위해 행동 전 지시 논리와 화면 근거를 평가하는 실현가능성 검증 프로토콜과, 과잉순응 실행을 종료 지향 행동으로 유도하는 조건부 행동 조절 메커니즘으로 구성된 추론 시점 프레임워크 CONFLICTGUARD를 제안한다. 5개의 널리 쓰이는 에이전트에 대한 실험에서 평상시 GUI 작업 성능을 유지하면서도 모순 작업 성공률을 유의미하게 끌어올렸다.
- •GUI 에이전트의 모순 지시 인지·실행 중단 능력을 평가하는 벤치마크 CONFLICTGUI 제안
- •실현 가능한 작업에 강한 에이전트일수록 모순 지시에서도 맹목적으로 실행을 계속하는 과잉순응 문제 확인
- •실현가능성 검증 프로토콜과 조건부 행동 조절로 구성된 추론 시점 프레임워크 CONFLICTGUARD 제안
- •5개 주요 GUI 에이전트 실험에서 평상시 성능 유지하며 모순 작업 성공률 유의미하게 향상
- •경량 추론 시점 개입만으로도 부적절한 실행 상황 인식 능력을 크게 개선할 수 있음을 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents
- 1.CONFLICTGUI는 GUI 에이전트가 실행 불가능한 지시를 인식하고 멈출 수 있는지 평가하는 벤치마크
- 2.성능 좋은 에이전트도 상충되는 지시 앞에서 맹목적으로 실행을 이어가는 '과잉순응' 현상 확인
- 3.CONFLICTGUARD는 실행 전 지시 논리·GUI 증거를 검증하는 추론 시점 개입 프레임워크
- 4.5개 주요 에이전트 실험에서 정상 작업 성능을 유지하면서 충돌 과제 성공률을 크게 향상
왜 중요한가?
GUI 자동화 에이전트가 잘못된 지시를 그대로 실행해 발생할 수 있는 오작동 위험을 줄이는 경량 개입 방법을 제시해, 실제 배포 환경에서의 안전성 확보에 실질적으로 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2609.03438v1 Announce Type: new Abstract: Graphical user interface (GUI) agents are increasingly used to execute natural-language instructions on user interfaces, yet real users may issue infeasible instructions due to benign mistakes. A reliable agent should not only know how to act, but also when not to act. In this work, we introduce CONFLICTGUI, a benchmark covering instruction-internal conflicts and instruction-GUI context conflicts to study conflict-aware termination. Our evaluation
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
