GenUI-Harness는 텍스트 기반 인간-에이전트 상호작용의 인지 과부하와 모호성 문제를 해결하기 위해, 정보 검색·과제 수행을 담당하는 Tool Agent와 모호성을 식별해 프런트엔드 코드를 생성하는 GUI Coder Agent를 결합한 멀티에이전트 하네스다. 상호작용형 UI 생성에 필요한 검증 가능 보상은 비용이 크고 LLM-as-Judge 보상은 보상 해킹에 취약하다는 문제를, 단일 샌드박스에서 보상을 수집하는 Dynamic UX와 보상 분포를 정제하는 Reward Auditor로 해결했다. 10개 실제 도메인 기반 UI-TAU Bench에서 GenUI-Harness는 smolagents보다 평균 Pass@3가 4.48%p 높았고, 4B급 모델의 Pass@3를 9.33%에서 58.00%로 끌어올려 Claude Opus 5(46.67%)를 넘어섰다. 또한 리뷰어 설문에서 생성된 UI는 대화 라운드를 평균 3.4회에서 1.2회로 줄이는 효과를 보였다.
- •정보검색 Tool Agent와 UI 코드 생성 GUI Coder Agent를 결합한 멀티에이전트 하네스 GenUI-Harness 제안
- •단일 샌드박스 보상 수집(Dynamic UX)과 보상 해킹 방지용 메타 보상(Reward Auditor)으로 RL 학습 문제 해결
- •UI-TAU Bench에서 smolagents 대비 평균 Pass@3 4.48%p 향상
- •4B 모델의 Pass@3를 9.33%→58.00%로 끌어올려 Claude Opus 5(46.67%) 능가
- •생성 UI 도입으로 사용자와의 대화 라운드가 평균 3.4회→1.2회로 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Interfaces Speak: Data-Aware Generative UI Harness for Active Interaction
- 1.GenUI-Harness 발표: Tool Agent·GUI Coder Agent 결합해 대화 라운드 3.4→1.2회로 축소
- 2.UI-TAU Bench에서 4B 모델 9.33%→58.00% Pass@3, Claude Opus 5(46.67%) 상회
- 3.Dynamic UX(보상 수집 샌드박스)·Reward Auditor(보상 해킹 방지)로 RL 훈련 두 난제 해결
왜 중요한가?
작은 4B 모델이 생성형 UI 훈련만으로 Claude Opus 5를 능가하는 벤치마크 성능을 보여, 텍스트 중심 상호작용을 구조화 UI로 대체하는 접근의 실효성을 입증한다.
본문 미리보기
arXiv:2610.11123v1 Announce Type: new Abstract: Most human-agent interaction today remains text-based. Natural language can impose cognitive overload, ambiguity, information chaos, and slow input for complex tasks; ephemeral generative UIs can present structured information and guide users toward task completion. We propose GenUI-Harness, a multi-agent harness pairing a Tool Agent for information retrieval and task execution with a GUI Coder Agent that identifies ambiguities and generates front
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안



![[Tech Insight] "AI 해킹, 보안 문제로만 보는 건 위험한 착각"](https://cdn.digitaltoday.co.kr/news/photo/202610/706229_653947_485.jpg)