자연어 설명만으로 완성된 웹사이트를 생성하는 LLM 훈련에서는 강화학습 보상 설계가 병목이었다. 수작업 브라우저 스크립트는 실행 가능하지만 개방형 요구사항에 대해 작성 비용이 크고, VLM·GUI 에이전트 채점기는 확장 가능하지만 결정적 상태를 보기 전에 판정을 내리는 문제가 있었다. 연구진은 각 웹사이트 요청에서 필요한 상호작용 흐름을 자율적으로 도출해 실행 가능한 '흐름 계약(Flow Contract)'으로 표현하고 그 실행 결과를 강화학습 보상으로 쓰는 자가진화형 프로그램 채점기 'WebGrader'를 제안했다. 실제 브라우저에서 생성된 프로젝트를 구현하고 소스코드·실시간 DOM에 목표 행동을 근거시켜 시각·DOM·응답·영속 상태 증거를 수집한다. WebGen-Bench에서 WebGrader로 훈련된 80억 매개변수 정책은 기능 성공률 52.01%를 기록해 외형+스크립트 결합 보상 대비 7.88포인트 높았고 o4-mini와 DeepSeek-v4-flash도 능가했다.
- •WebGrader는 자연어 요청에서 상호작용 흐름을 자동 도출해 실행 가능한 보상 채점기를 만든다.
- •실제 브라우저에서 생성 결과를 구현해 시각·DOM·응답·상태 증거를 수집하는 방식이다.
- •WebGen-Bench에서 80억 매개변수 정책이 기능 성공률 52.01%를 달성했다.
- •이는 외형+스크립트 결합 보상 대비 7.88포인트 높은 수치다.
- •o4-mini와 DeepSeek-v4-flash를 능가하는 성능을 보였다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
본문 미리보기
arXiv:2608.06474v1 Announce Type: new Abstract: Large language models increasingly generate complete websites from natural-language descriptions, and reinforcement learning has become a central approach to closing their remaining functional gap. This training regime is bottlenecked by reward design. Hand-authored browser scripts are executable yet costly to write for open-ended requirements, while VLM and GUI-agent graders scale but may issue verdicts before observing the decisive state. We pro
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:11AI 초안

