GUI 에이전트 개선은 보통 전문가 궤적의 행동 복제에 의존하지만, 현재 정책이 전문가 정책에서 벗어나면 폐루프 실행 중 전문가 궤적 밖의 '정책 유발 이탈 상태'를 만나게 되고 이런 상태엔 시연이 없어 효과적 감독이 부재하다. SGCD(Skill-Guided Continuation Distillation)는 이 감독 공백을 메우는 반복적 자기개선 프레임워크로, 먼저 스킬 안내 없이 평범한 정책을 몇 스텝 돌려 현실적 이탈 상태에 도달한 뒤, 그 상태에서 스킬 안내 정책이 과제를 완수해 성공적 연속(continuation)을 만들고 이를 전문가 궤적과 섞어 이탈 상태에 대한 감독을 공급한다. 스킬은 성공·실패 롤아웃 모두에서 추출되며 연속 계획·핵심 표적·실패 함정·성공 기준으로 구성된다. OSWorld-Verified에서 세 베이스 모델의 성공률을 30% 초반대에서 50% 이상으로 끌어올려 효과성과 일반성을 입증했다.
- •행동 복제가 다루지 못하는 '정책 유발 이탈 상태'의 감독 공백을 표적화
- •평범한 정책로 이탈 상태에 도달 후 스킬 안내 정책이 완수해 연속 생성
- •스킬은 연속 계획·핵심 표적·실패 함정·성공 기준으로 구성, 성공·실패 롤아웃에서 추출
- •OSWorld-Verified에서 세 모델 성공률을 30% 초반→50% 이상으로 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Skill-Guided Continuation Distillation for GUI Agents
- 1.SGCD: GUI 에이전트의 정책 이탈 상태 감독 공백을 메우는 자기개선 프레임워크
- 2.스킬 안내 없는 정책을 몇 스텝 실행해 현실적 이탈 상태에 도달 후 스킬 정책으로 완성
- 3.스킬을 연속 계획·핵심 목표·실패 함정·성공 기준으로 구성해 성공·실패 롤아웃에서 추출
- 4.OSWorld-Verified에서 3개 기본 모델 성공률을 30%대에서 50% 이상으로 향상
왜 중요한가?
전문가 궤적 행동복제에 의존하던 GUI 에이전트가 폐루프 실행 중 마주치는 미지의 이탈 상태에 감독이 없던 한계를, 스킬 기반 연속 궤적으로 보완해 성공률을 크게 끌어올린다.
기업 및 공공 부문에서 업무 자동화와 효율성 향상에 대한 요구가 큰 한국 시장에서, GUI(그래픽 사용자 인터페이스) 에이전트의 안정성 개선은 매우 중요합니다. 이 기술은 실제 운영 환경에서 정책 이탈로 인한 오류를 줄여 AI 기반 자동화 시스템의 신뢰도를 높이고 국내 산업 전반의 생산성 향상에 기여할 수 있습니다.
본문 미리보기
arXiv:2606.18890v1 Announce Type: new Abstract: Improving GUI agents typically relies on behavior cloning on expert trajectories. However, as the current policy deviates from the expert policy, it inevitably encounters policy-induced off-trajectory states during closed-loop execution, i.e., states that fall outside the expert trajectories. Since expert trajectories provide no demonstrations for these unseen states, such states receive no effective supervision, leaving the policy unable to selec
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안

