Ria Khatoniar의 LLM 최적화 패러다임 전환 리뷰 — PPO·GRPO가 '언어로 답하는 모델을 숫자로 보상'하는 구조적 미스매치를 갖는다. 스칼라 리워드는 토큰별 기여를 구분 못함(TD learning으로 보정하지만 간접적·노이즈). 새 3가지 방법론 비교: (1) **TextGrad** — 수치 미분 대신 '자연어 gradient'로 계산 그래프 역전파, LeetCode Hard 23%→36%, (2) **MIPRO** — 지시·데모 조합의 구조화 탐색, TPE 베이지안 최적화로 프롬프트 구성 찾기, HotPotQA 36.1→46.4, (3) **GEPA** — Pareto frontier 유지 + reflection 기반 mutation + 시스템 인식 merging으로 TextGrad+MIPRO 결합. GEPA는 GRPO 대비 24,000 rollout vs 678로 비슷~우월 성능, Qwen3 8B 최적화 프롬프트가 GPT-4.1 Mini에 +9% 이전. 핵심 전환: 파라미터 공간에서 프롬프트 공간으로, 스칼라에서 구조화 피드백으로.
- •PPO/GRPO는 언어 모델을 '숫자 리워드'로 최적화하는 근본 미스매치 — 구조적 피드백 손실.
- •TextGrad: 자연어 gradient로 계산 그래프 역전파, LeetCode Hard 23%→36%, GPT-4o.
- •MIPRO: 지시·데모 조합 구조화 탐색 + TPE 베이지안 최적화, HotPotQA 36.1→46.4.
- •GEPA: Pareto frontier + reflection mutation + merging — GRPO 대비 35x 적은 rollout으로 동급 이상.
- •Qwen3 8B 최적화 프롬프트가 GPT-4.1 Mini에 +9% 이전 — 모델 간 일반화.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What If LLMs Learn Better from Language Than from Rewards?

- 1.LLM 포스트트레이닝 패러다임: 스칼라 리워드 → 구조화 언어 피드백으로 이동.
- 2.TextGrad(자연어 gradient) / MIPRO(구조화 탐색) / GEPA(둘 결합) 3세대 흐름.
- 3.GEPA가 GRPO 대비 35x 적은 rollout으로 동급 이상 성능 — 샘플 효율 혁명.
- 4.Qwen3 8B 최적화 프롬프트가 GPT-4.1 Mini에 +9% 이전 — 모델 간 일반화.
- 5.최적화 대상이 파라미터 공간에서 프롬프트 공간으로 이동.
왜 중요한가?
RLHF/GRPO 이후 LLM 최적화의 다음 세대 방법론을 이해하는 핵심 자료. 특히 한국 AI 연구실·스타트업(Upstage·LG·네이버 HyperCLOVA)이 post-training을 검토할 때 스칼라 리워드 기반 RL 대신 프롬프트 공간에서 sample-efficient 방법론으로 리소스 재배분 가능성 제시. GEPA 오픈 구현이 있다면 즉시 실험 대상.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:44AI 초안

