에이전트 LLM의 iterative self-correction 효용을 사이버네틱 피드백 루프로 모델링한 실증 연구. 동일 LLM이 controller·plant 역할을 동시 수행, {Correct, Incorrect} 2상 마르코프 모델로 'ECR/EIR > Acc/(1-Acc)' 단순 배포 진단 제시. 7개 모델·3개 데이터셋(GSM8K·MATH·StrategyQA) 실험 결과 EIR ≤0.5% 임계점이 자기수정 도움/해 경계. o3-mini·Claude Opus 4.6·o4-mini만 비퇴화, GPT-5는 -1.8pp 퇴화. verify-first prompt 개입으로 GPT-4o-mini의 EIR 2%→0%, -6.2pp → +0.2pp 인과 입증. 자기수정은 default가 아닌 통제 결정으로 다뤄야 한다는 결론.
- •Self-correction을 사이버네틱 feedback 루프로 모델링 — 동일 LLM이 controller·plant.
- •ECR/EIR > Acc/(1-Acc) 단순 배포 진단 + EIR을 stability margin으로 해석.
- •EIR ≤0.5% sharp 임계점이 자기수정 도움/해 경계 — 7모델·3데이터셋 실증.
- •o3-mini·Claude Opus 4.6·o4-mini 비퇴화 / GPT-5 -1.8pp 퇴화 — 모델별 격차 큼.
- •Verify-first 프롬프트가 GPT-4o-mini의 -6.2pp 퇴화를 +0.2pp로 반전 — 인과 입증.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention
- 1.반복 자기교정이 에이전트 LLM 시스템에서 도움이 되는지 해가 되는지를 사이버네틱 피드백 루프로 분석
- 2.EIR≤0.5% 임계값이 유익한 자기교정과 해로운 자기교정을 구분하는 날카로운 경계로 확인
- 3.o3-mini, Claude Opus 4.6만 비성능저하; GPT-5는 -1.8pp 하락 확인
- 4.검증 우선 프롬프팅이 인과적 개입으로 EIR을 낙줘 자기교정을 유익하게 전환 가능
왜 중요한가?
자기교정을 기본 동작이 아닌 측정 가능한 오류 동역학에 의해 제어되는 설계 결정으로 다뤄야 한다는 시각은 에이전트 시스템 신뢰성 향상에 직접적 실용 가치를 제공한다.
본문 미리보기
arXiv:2604.22273v1 Announce Type: new Abstract: Iterative self-correction is widely used in agentic LLM systems, but when repeated refinement helps versus hurts remains unclear. We frame self-correction as a cybernetic feedback loop in which the same language model serves as both controller and plant, and use a two-state Markov model over {Correct, Incorrect} to operationalize a simple deployment diagnostic: iterate only when ECR/EIR > Acc/(1 - Acc). In this view, EIR functions as a stability m
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:45AI 초안

