연구진은 테스트 시점에 반복적으로 해법을 개선하는 능력으로 정의되는 LLM 에이전트의 자기개선 역량을 높이기 위해 AREX-2를 제시했다. 이 능력은 현재보다 나은 해법을 만드는 반성과 여러 라운드에 걸쳐 반복을 효과적으로 유지하는 장기 실행 두 가지 보완적 능력에 기반하며, 두 능력 모두 도메인에 무관하다는 가정 아래 검증 가능한 피드백을 제공하는 머신러닝과 알고리즘 프로그래밍 과제에서 장기 개선 궤적을 합성해 학습시켰다. Qwen3.8-27B 기반 에이전트는 MLE-bench Lite에서 81.8점, Frontier-CS에서 70.7점을 기록했고, 딥리서치 영역으로도 전이돼 BrowseComp 84.0점, HLE 52.6점, GAIA 92.2점, DeepSearchQA 93.8점을 달성했으며 라운드 예산이 늘어날수록 계속 성능이 향상됐다.
- •자기개선 능력을 반성과 장기 실행 둘 보완적 능력으로 정의했다
- •머신룩닝과 알고리즘 프로기말쇝 과제에서 장기 개선 교사리플래젼맴륨를 합성해 학습했다
- •Qwen3.8-27B 기반 에이전트거 MLE-bench Lite 81.8점과 Frontier-CS 70.7점을 기륥했다
- •딕리서지 영역으로도 전이돼 BrowseComp 84.0, HLE 52.6, GAIA 92.2, DeepSearchQA 93.8을 달성했다
- •반복 래운놩 예산이 뚠어단수른 성륧이 지속적으로 향상됐다
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
- 1.AREX-2, 테스트 시점에 반복적으로 해를 개선하는 자기개선 LLM 에이전트 프레임워크 공개
- 2.머신러닝·알고리즘 프로그래밍 과제의 장기개선 궤적으로 반성·장기실행 능력 학습
- 3.Qwen3.8-27B 기반, MLE-bench Lite 81.8점·Frontier-CS 70.7점 기록
- 4.딥리서치 전이서 BrowseComp 84.0·HLE 52.6·GAIA 92.2·DeepSearchQA 93.8, 라운드 늘수록 향상
왜 중요한가?
반성과 장기실행이 도메인 무관하게 학습 가능하다는 가설을 검증 가능한 두 도메인 데이터로 입증해, 검색·리서치 등 전혀 다른 과제로도 전이되는 범용 자기개선 능력의 가능성을 보여준다.
언급 프로젝트
본문 미리보기
arXiv:2609.38288v1 Announce Type: new Abstract: We present AREX-2, an effort to advance the self-improving capability of LLM agents, which we define as the ability to iteratively refine a solution at test time. This ability rests on two complementary capabilities: reflection, which produces a solution better than the current one, and long-horizon execution, which keeps the iteration effective over many rounds. We hypothesize that both capabilities are domain-agnostic, and can therefore be learn
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

