아마존이 Nova Forge의 멀티턴 강화학습(RFT)에서 커스텀 보상 함수를 설계하는 방법을 실제 사례로 소개했다. 노바 라이트 2.0에게 코드를 짜기 전 명세가 불충분하면 먼저 질문하도록 학습시키기 위해, 정답률(1.0)·선질문 후코딩(0.6)·즉시 추측 페널티(-1.0)·반복 턴 페널티(-0.5) 등 4개 요소를 GRPO로 가중합하는 보상 구조를 설계했다. 초기 버전은 질문 보상이 정답률에 종속되고 효율성 항목이 퇴화된 최적점을 만들어 모델이 학습 첫 턴부터 무조건 추측하는 방향으로 붕괴됐다. 원인은 특정 보상 요소가 모든 롤아웃에서 동일한 값을 반환해 그룹 내 분산이 사라지는 '조용한 붕괴' 현상이었다. 해법은 목표 행동을 독립적으로 보상하고 실패 유형을 명시적으로 페널티화하며, 집계 보상이 아니라 요소별 그룹 내 표준편차를 모니터링하는 것이었다.
- •질문 후 코딩 유도를 위해 정답률·선질문보상·즉시추측페널티·반복턴페널티 4개 요소를 GRPO로 가중합산
- •질문 보상이 정답률에 종속되고 효율성 항목이 퇴화된 초기 설계로 인해 모델이 '메 철에 무조건 추측'하는 방향으로 붕괴
- •특정 보상 요소가 모든 롡아웃에서 동일한 값을 반환해 그룹 내 분산이 0이 되면 학습에 전혀 기여하지 않는 '조용한 붕괴' 현상 관측
- •집계 보상 곱선이 아니라 요소별 그룹 내 표준편차를 모니터링해야 죽은 채널을 발견 가능
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge
본문 미리보기
In multi-turn reinforcement learning, your custom reward function decides what the model actually learns. This post shows how to design a composite multi-turn reward for Amazon Nova Forge, execute model-generated code safely inside it, and instrument each component to catch the pitfalls that quietly collapse a reward.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:55AI 초안

