이 논문은 LLM 강화학습에서 신뢰도 할당(credit assignment)의 핵심 요소인 '전송 연산자(transport operator)'가 기존에는 트랜스포머 정책 고유의 계산 구조를 반영하지 못했다는 문제를 지적하며, 이를 해결하는 '계산조건부 신뢰 전송(CCT)' 프레임워크와 구체 알고리즘 CompPO를 제안한다. CompPO는 어텐션 집중도를 토큰 단위 유지 게이트로 매핑해 한 단계 부트스트랩과 경로 의존적 이점 추적(Comp-GAE)에 모두 활용하고, 액터의 은닉 상태를 재사용하는 전송 정렬 크리틱(TAC)을 함께 설계했다. Qwen3-4B 5개 시드 실험에서 CompPO는 최종 정확도 61.4%를 기록해 튜닝된 GRPO(53.8%)를 크게 앞섰으며, Comp-GAE나 TAC 중 하나만 적용한 모델보다도 우수해 두 요소의 상호작용 효과가 확인됐다. PPO 그리드 12회 실행 중 10회에서 안정적으로 작동해 GRPO(3회)보다 훨씬 견고했다.
- •트랜스포머 계산 구조를 반영하는 신뢰 전송 프레임워크 CCT·알고리즘 CompPO 제안
- •Qwen3-4B 실험서 정확도 61.4%로 튜닝된 GRPO(53.8%) 큰 폭 상회
- •어텐션 집중도 기반 유지게이트+전송정렬 크리틱(TAC) 결합이 핵심
- •PPO 그리드 12회 중 10회 안정 작동(GRPO는 3회)으로 안정성도 우수
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning
- 1.LLM 강화학습 신용할당을 '전송 연산자' 관점서 재정의한 CCT 프레임워크·CompPO 알고리즘 제안
- 2.Qwen3-4B 5개 시드 실험서 CompPO 정확도 61.4%로 튜닝된 GRPO(53.8%) 상회
- 3.어텐션 집중도를 토큰별 보유 게이트로 변환, 액터 은닉상태 재사용하는 전송정렬 크리틱 설계
- 4.Qwen3-4B·Llama-3.1-8B-Instruct서 GRPO 대비 각 4.3, 3.9포인트 pass@1 개선
왜 중요한가?
기존 GAE·그룹상대적 방법이 트랜스포머 내부 계산을 반영 못했던 한계를 실제 어텐션 계산에 조건화한 신용할당으로 보완해, LLM 강화학습의 안정성과 성능을 함께 끌어올린 개선안을 제시한다.
본문 미리보기
arXiv:2608.21501v1 Announce Type: new Abstract: Credit assignment in large-language-model reinforcement learning (LLM RL) can be separated into three objects: evidence about success, a transport operator that converts this evidence into token-level advantages, and an update geometry that turns advantages into policy changes. Recent work has greatly improved evidence, sampling, and update geometry, but the transport operator is usually architecture-agnostic. Fixed-discount GAE applies a stationa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
