Procedural Memory Distillation(PMD)은 RLVR 학습에서 버려지던 에피소드 간 절차적 신호(성공 전략, 반복 실패 패턴)를 재사용 가능한 메모리로 축적하고 이를 학습 중 모델 가중치에 증류하는 기법이다. 메모리를 원시 궤적, 자기 성찰 전략·교훈, 상위 행동 패턴의 3단계로 조직하고, 메모리 조건부 자기 교사가 학생 모델의 롤아웃을 감독해 추론 시에는 메모리 없이 동작한다. Qwen3-8B와 OLMo3-Instruct-7B에서 SDPO 대비 SCIKNOWEVAL 3.8~5.5%, LIVECODEBENCH 7.9~13.6% 향상됐고, 메모리나 정책 한쪽을 고정하면 10% 이상 뒤처져 정책-메모리 공진화가 핵심임을 보였다. 외부 메모리 없이 자기 개선하는 LLM 학습의 실용적 경로를 제시한다.
- •에피소드 단위 보상만 쓰는 RLVR/SDPO와 달리, 에피소드 간 교차 신호를 절차적 메모리로 변환해 가중치에 증류
- •메모리를 원시 굤적→자기 성찰 전략→상위 행동 패턴의 3단계 추상화로 온라인 구성
- •학습 스캐폴드로만 쓰이고 추론 시에는 메모리가 필요 없는 memory-free 모델 생성
- •SDPO 대비 SCIKNOWEVAL 3.8~5.5%, LIVECODEBENCH 7.9~13.6% 향상 (Qwen3-8B, OLMo3-Instruct-7B)
- •메모리나 정책 한쪽을 고정하면 10%p 이상 성능 하락 — 정책-메모리 공진화가 성능의 원천
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Procedural Memory Distillation: Online Reflection for Self-Improving Language Models
- 1.RLVR 롤아웃의 절차 정보를 재사용해 정책 가중치에 증류하는 PMD(절차 메모리 증류) 제안
- 2.원시 궤적·자기성찰 전략·행동 패턴 3단계 메모리를 온라인 구축, 자기교사가 학생을 감독
- 3.Qwen3-8B·OLMo3-7B에서 SDPO 대비 SciKnowEval 3.8~5.5%, LiveCodeBench 7.9~13.6% 향상
- 4.추론 시 메모리 불필요, 메모리·정책 중 하나만 동결해도 10% 이상 하락해 공진화 효과 입증
왜 중요한가?
RLVR가 버려온 에피소드 간 절차 신호(반복 성공 전략·지속 실패 패턴)를 학습에 흡수해 과학·코드 벤치마크를 큰 폭 개선했다. 메모리를 훈련 스캐폴드로만 쓰고 추론 시엔 제거해 배포 비용 증가 없이 자기개선 학습을 실현한 점이 실용적이다.
언급 프로젝트
본문 미리보기
arXiv:2607.01480v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR), along with recent selfdistillation variants such as SDPO, evaluates each rollout against a verifier and updates the policy from that episode-level signal. However, the richer procedural information in the rollout is rarely retained or reused. Across episodes and epochs, the model repeatedly encounters related problems under a changing policy, producing cross-episode signals that episode-local
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

