연구진은 ReAct 기반 에이전트가 행동 제안·환경 상호작용·완료 판단을 단일 LLM 정책에 맡겨 오류가 전파되고 근거 없는 완료 주장이 실행을 종료시키는 문제를 해결하기 위해, 두 개의 게이팅 정책을 외부화한 모듈형 아키텍처 'DeReAct'를 제안했다. 제안된 행동을 실행 전에 검증하는 '크리틱(Critic)'과 환경에 기반한 상태를 재구성해 과제 완료를 인증하는 '컨텍스트 매니저(Context Manager)'로 구성된다. GAIA와 SWE-bench Verified 평가에서 DeReAct는 상대적으로 약한 두뇌 모델에 가장 큰 Pass@1 향상을 가져왔는데, Qwen3-Coder-480B는 6.5~7.0점, Claude Sonnet 4.5는 4.2~5.2점 상승했으며 두뇌 모델의 역량이 높아질수록 개선폭은 줄었다. Claude Opus 4.5에서는 Pass@1이 ReAct와 비슷하지만 더 증거가 완전하고 제약을 만족하는 경로를 산출해, 완료 제어가 조기 종료를 더 강한 근거 확보로 바꿀 수 있음을 보였다.
- •행동 승인을 다린 '커림틱(Critic)'가 완료를 인증하뒬 '컨텍스트 매니저'로 게이팅을 외미컥섬 모눤형 아키톥쾘쳐 DeReAct
- •GAIA·SWE-bench Verified에서 약한 둘놨 모델(Qwen3-Coder-480B +6.5~7.0, Claude Sonnet 4.5 +4.2~5.2점) 개선 가장 훌
- •둘놨 모델 역놥이 높을수록 개선폭 감소하는 패턴
- •Claude Opus 4.5에서는 Pass@1 마일하나 더 증거 완늤한 경로 생성으로 구기 강화 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents
- 1.DeReAct는 행동을 검증하는 Critic과 작업 완료를 인증하는 Context Manager를 메인 정책에서 분리
- 2.GAIA·SWE-bench에서 Qwen3-Coder-480B는 6.5~7.0%p, Claude Sonnet 4.5는 4.2~5.2%p 개선
- 3.두뇌 역할 모델이 강력해질수록(Claude Opus 4.5) 개선폭은 줄지만, 더 근거가 충분한 완료 판단을 내림
- 4.단일 LLM이 행동 제안·완료 판단을 모두 맡던 ReAct 구조의 오류 전파 문제를 구조적으로 줄임
왜 중요한가?
약한 모델일수록 외부 검증 게이트를 추가하는 것이 성능을 크게 끌어올리고, 강한 모델에서도 더 근거 있는 완료 판단을 가능하게 해 에이전트 신뢰성 설계에 실질적 지침을 준다.
본문 미리보기
arXiv:2610.02351v1 Announce Type: new Abstract: ReAct-based agents typically rely on a single LLM policy to propose actions, interact with the environment, and decide when a task is complete. This coupling makes action authorization and completion control difficult to enforce independently, allowing errors to propagate and unsupported completion claims to terminate execution. We introduce DeReAct, a modular agent architecture that externalizes two gating policies: a Critic that validates propos
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

