ICRL은 강화학습을 활용해 LLM 기반 에이전트가 외부 비평 없이도 자기 개선 능력을 내재화하도록 훈련하는 새로운 프레임워크다. 공유 백본에서 솔버와 비평가를 공동 훈련하며, 비평가는 솔버의 후속 성능 향상에 따라 보상받아 실행 가능한 피드백 생성을 유도한다. 분포 보정 재가중치 비율과 역할별 그룹 이점 추정으로 비평 조건부 행동과 비평 없는 행동 간의 분포 이동을 해결한다. Qwen3-4B 및 8B로 평가한 결과 에이전틱 과제에서 GRPO 대비 평균 6.4점, 수학적 추론에서 7.0점 향상을 달성했다.
- •LLM 에이전트가 배포 시 외부 비평 없이도 자기 개선 능력을 발휘할 수 있도록 수렴성을 내재화한다.
- •비평가는 솔버의 후속 성능 향상에 따라 보상받아 실행 가능한 피드백 생성을 장려한다.
- •분포 보정 재가중치 비율이 비평 조건부와 비평 없는 행동 간 분포 이동 문제를 해결한다.
- •Qwen3-8B 비평가가 32B 비평가와 비교 가능한 성능을 훨씬 적은 토큰으로 달성한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ICRL: Learning to Internalize Self-Critique with Reinforcement Learning
- 1.ICRL은 강화학습으로 LLM 에이전트가 외부 비평 없이 스스로 오류를 수정하는 능력을 내재화하는 프레임워크
- 2.솔버와 비평가를 공동 학습해 비평 유도 성공을 독립적 능력으로 전환
- 3.에이전틱 태스크에서 GRPO 대비 평균 6.4점, 수학 추론에서 7.0점 향상
- 4.8B 학습된 비평가가 32B 비평가와 대등한 성능을 훨씬 적은 토큰으로 달성
왜 중요한가?
LLM 에이전트가 런타임에 외부 비평 의존 없이 자기 교정 능력을 내재화할 수 있어, 자율 에이전트의 신뢰성과 비용 효율을 동시에 크게 향상시킨다.
본문 미리보기
arXiv:2605.15224v1 Announce Type: new Abstract: Large language model-based agents make mistakes, yet critique can often guide the same model toward correct behavior. However, when critique is removed, the model may fail again on the same query, indicating that it has not internalized the critique's guidance into its underlying capability. Meanwhile, a frozen critic cannot improve its feedback quality over time, limiting the potential for iterative self-improvement. To address this, we propose l
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

