LLM의 과학적 아이디어 자동 생성에서 강화학습 적용 시 발생하는 보상 해킹(reward hacking) 문제를 해결하기 위한 RL 프레임워크를 제안한다. 저자들은 방법론적 검증과 구현 세부사항을 분리하고 보상 해킹에 강건한 엄격한 이진 보상을 제공하는 최초의 다중 에이전트 보상 함수를 판정자로 도입했다. 희소 보상 신호를 효과적으로 최적화하기 위해 Group Relative Policy Optimization의 비편향 변형을 사용해 인위적 길이 편향을 완화했다. ICLR 2024 논문집에서 추출한 문제-해결책 쌍 데이터셋 ICLR-320을 학습에 활용했으며, 실험 결과 제안 프레임워크가 신규성·실현 가능성·효과성 등 전문가 평가 지표에서 SOTA 베이스라인을 크게 능가했다.
- •과학적 아이디어 생성에 RL을 적용하며 보상 해킹 문제를 해결하는 프레임워크 제안
- •다중 에이전트 판정 보상 함수로 방법론·구현 분리 및 이진 보상 제공
- •비편향 GRPO로 길이 편향 완화
- •ICLR 2024 논문들에서 추출한 데이터셋 ICLR-320 구축
- •신규성·실현성·효과성에서 전문가 평가 SOTA 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training
- 1.과학적 아이디어 생성을 위한 RL 프레임워크 제안
- 2.다중 에이전트 심판이 방법론과 구현을 분리 평가
- 3.편향 없는 GRPO 변형으로 희소 신호를 효과적 최적화
- 4.ICLR-320 데이터셋 기반 학습으로 SOTA 베이스라인 능가
왜 중요한가?
LLM 기반 과학적 아이디어 생성의 환각과 보상 해킹 문제를 이중 구조의 보상 함수로 해결합니다.
언급 프로젝트
본문 미리보기
arXiv:2604.16723v1 Announce Type: new Abstract: Large Language Models (LLMs) have demonstrated potential in automating scientific ideation, yet current approaches relying on iterative prompting or complex multi-agent architectures often suffer from hallucination or computational inefficiency. A critical bottleneck in applying Reinforcement Learning (RL) to this open-ended domain is reward hacking -- where models exploit imperfect evaluation proxies to maximize scores without producing genuine s
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:43AI 초안

