SCAFFOLD는 시각적으로 복잡하고 사이트마다 달라지는 장기 과제형 웹 인터페이스를 다루는 웹 에이전트가 절차적 지식을 축적하지 못하고 매번 과제를 독립적으로 학습하는 문제를 해결하는 자기개선형 프레임워크다. 성공한 궤적으로부터 다중 인스턴스 추상화 제약 하에 파라미터화된 실행 가능 스킬을 유도하고, 상위 스킬이 하위 스킬을 호출하는 재귀적 계층 구조를 유지하며, 최소 설명 길이 기준과 행동적 동등성 검사로 라이브러리를 압축하고, 스킬이 반영된 궤적을 주기적으로 모델 가중치에 다시 증류해 내재화한다. WebArena, VisualWebArena, Online-Mind2Web 홀드아웃 분할 실험에서 가장 강력한 스킬 증강 베이스라인 대비 성공률을 11.1~17.2%포인트 향상시켰고, 다섯 차례의 자기개선 반복 동안 라이브러리 붕괴 없이 단조롭게 성능이 개선됐다.
- •성공 교적에서 파라미터화된 실행 가능 스타을 추출해 재귀적 계층으로 관리하는 SCAFFOLD 제안
- •최소 설명 길이(MDL) 기준과 행동적 동등성 검사로 스킬 라이브러리를 압축해 중복 문제 해결
- •WebArena 등 3개 벤치마크에서 최강 베이스라인 대비 성공률 11.1~17.2%p 향상
- •5회 자기개선 반복 동안 라이브러리 붕괴 없이 단조 성능 향상 확인, 코드 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SCAFFOLD: Self-Improving Web Agents via Recursive Parametric Skill Abstraction
- 1.성공 궤적에서 파라메트릭 실행가능 스킬을 추출해 재귀적으로 구성하는 자기개선 웹 에이전트 'SCAFFOLD' 제안
- 2.최소기술길이(MDL) 기준과 행동동등성 검사로 스킬 라이브러리를 압축, 주기적으로 모델 가중치에 재증류
- 3.WebArena·VisualWebArena 등에서 최강 스킬증강 베이스라인 대비 성공률 11.1~17.2%p 향상
- 4.5회 자기개선 반복에서도 라이브러리 붕괴 없이 단조 성능 향상 확인, 코드 공개
왜 중요한가?
기존 스킬 캐시가 평면적이던 한계를 넘어 계층적 스킬 구성과 압축을 도입해, 웹 에이전트가 장기적으로 누적 학습하면서도 라이브러리가 무한 팽창하지 않는 실용적 구조를 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2609.05511v1 Announce Type: new Abstract: Web agents need to navigate visually rich, long-horizon interfaces that change across sites, yet most previous agents still learn each task in isolation and discard the procedural knowledge they accumulate. Recent skill-augmented frameworks take an important first step, but they treat the skill library as a flat or two-tier prompt-side cache and offer no principled mechanism for compressing redundancy or composing skills recursively. We introduce
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

