이 논문은 실서비스에서 강력한 상용 모델 대신 경량 로컬 모델을 배포한 뒤 더 강한 교사 모델의 온라인 지도로 지속 학습시키는 웹 에이전트 시나리오에서, 기존 궤적 단위 선호 최적화가 해결 불가능한 에피소드나 중복된 실행 턴에 예산을 낭비한다는 문제를 지적한다. 이를 해결하기 위해 언제 교사에게 질의할지 결정하는 해결가능성 인지 게이트와 어떤 정보성 있는 턴을 남길지 결정하는 점수 기반 턴 선택 메커니즘을 결합한 예산 인지형 프레임워크를 제안한다. MiniWoB와 TimeWarp 실험에서 이 방법은 첫 시도 성공률을 유지하면서도 교사 호출을 평균 22.6%, 학생 학습 연산량을 52.1% 줄였다.
- •웹 에이전트의 온라인 교사-학생 학습에서 '언제·무엇을' 가르칠지 최적화하는 프레임워크 제안
- •해결가능성 인지 게이트 + 점수 기반 턴 선택으로 예산 냭비 요소 제거
- •MiniWoB·TimeWarp 실험에서 성공률 유지하며 교사 호출 22.6%, 학습 연산량 52.1% 절감
- •코드 공개(GitHub)로 재현 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When and What to Teach: Budget-Aware Online Adaptation for Web Agents
- 1.배포 후 경량 로컬 웹 에이전트를 강한 교사 모델로 온라인 학습시키는 예산인식 프레임워크 제안
- 2.언제 교사에게 질의할지 결정하는 해결가능성 게이트와 어떤 턴을 남길지 정하는 점수기반 선택 메커니즘 결합
- 3.MiniWoB·TimeWarp 실험에서 최초 성공률은 유지하며 교사 호출 22.6%, 학생 훈련 연산량 52.1% 절감
- 4.표준 궤적 단위 선호 최적화가 해결불가 에피소드·중복 실행 턴에 예산을 낭비한다는 문제를 실증
왜 중요한가?
상용 대형 모델 사용이 비용 부담인 실무 환경에서, 경량 모델의 온라인 학습 비용을 절반 수준으로 줄이면서 성능을 유지하는 실용적 경로를 제시한다.
본문 미리보기
arXiv:2609.05513v1 Announce Type: new Abstract: Web agents have achieved significant success in automating complex internet tasks but deploying them in real-world environments requires continuous online adaptation. Given that deploying powerful proprietary models remains commercially cost-prohibitive, practitioners must rely on lightweight local models that evolve post-deployment via online teaching from a stronger teacher. However, standard interactive feedback imposes prohibitive costs. We sh
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

![[10월8일] “수학 문제 4000개에 AI 투입해 성과”…오픈AI가 보여준 과학연구의 변화](https://cdn.aitimes.com/news/photo/202610/216072_220045_048.png)

