자연어 피드백이 단순 반복 시도 이상의 개선을 실제로 만들어내는지를 통제 실험으로 검증한 연구다. Omni-MATH, Codeforces, BBEH Linguini, ARC-AGI1에서 오픈웨이트 모델 13개를 학생·교사 역할로 배치한 학생-교사 프로토콜을 설계해 외부 피드백, 자기 피드백, 무지도 자기개선을 비교했다. 그 결과 자기 생성 피드백은 무지도 자기개선 대비 이득이 거의 없었고, 강력한 외부 교사만이 피드백 고유의 큰 성능 향상을 만들어냈다. 또한 상호작용 이득은 교사의 정체성보다 학생이 피드백을 활용하는 능력에 더 좌우됐다. 피드백 기반 에이전트는 반복 시도 베이스라인과 비교해 평가해야 하며, 피드백 활용 능력이 대화형 개선의 핵심 병목임을 보여준다.
- •멀티턴 정확도 향상이 피드백 덕분인지 재샘플링·추가 연산 때문인지 분리하는 학생-교사 통제 프로토콜 제안
- •오픈웨이트 모델 13개를 4개 벤치마크(Omni-MATH, Codeforces, BBEH Linguini, ARC-AGI1)에서 평가
- •자기 피드백은 무지도 자기개선과 차이가 미미, 강한 외부 교사만 피드백 고유 이득 발생
- •상호작용 이득은 교사보다 학생의 피드백 활용 능력이 좌우, 평가 프레임워크 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What Drives Interactive Improvement from Feedback?
- 1.자연어 피드백의 효과를 단순 재시도 효과와 분리하는 통제된 학생-교사 프로토콜 제안(ICML 2026 워크숍)
- 2.Omni-MATH·Codeforces·BBEH Linguini·ARC-AGI1에서 오픈웨이트 13개 모델을 양역할로 평가
- 3.자기 피드백은 무지원 자기개선 대비 효과 미미, 강력한 외부 교사만 유의미한 추가 이득 확인
- 4.이득을 좌우하는 건 교사 정체성보다 학생의 피드백 활용 능력이라는 점도 규명
왜 중요한가?
멀티턴 성능 향상이 '피드백 덕분'이라는 통념에 반해, 자기 피드백은 사실상 재시도와 다르지 않음을 실증했다. 피드백 기반 에이전트는 반복 시도 베이스라인과 비교해 평가해야 하며, 피드백을 실제로 반영하는 능력이 핵심 병목이라는 결론은 self-refinement 설계 전반에 경종을 울린다.
언급 프로젝트
본문 미리보기
arXiv:2606.30774v1 Announce Type: new Abstract: We study when natural-language feedback produces improvement beyond the gains obtainable from repeated attempts alone. In multi-turn language agent setting, higher final accuracy can reflect useful feedback, but it can also arise from resampling, format correction, or additional test-time computation. To separate these effects, we introduce a controlled student-teacher protocol across Omni-MATH, Codeforces, BBEH Linguini, and ARC-AGI1, evaluating
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

