Contrastive Reflection은 에이전트형 정보검색(IR) 워크플로의 프롬프트 최적화를 맹목적 탐색이 아니라 '디버깅'처럼 다루는 반복 프레임워크다. QA 에이전트의 검색·추론 트레이스와 채점 에이전트의 차원별 점수·근거를 활용해 오류가 고정된 행동 슬라이스를 식별하고, 같은 영역의 성공 사례를 추가한 뒤 Teacher LLM에 표적 프롬프트 수정을 제안받는다. 검증 성능이 개선될 때만 수정을 채택하며 선택적 회귀 검사를 건다. HotpotQA 검색증강 QA에서 트리 기반 슬라이스 선택으로 단일 대조 수리만으로 보류셋 정확도를 51.4%→60.4%로 높였고, 실패만 보거나 무작위 증거를 쓰는 변형은 개선이 적고 기존 정답을 더 많이 깨뜨렸다. MIPROv2(59.4%)·GEPA(57.0%)에 근접한 해석 가능·검증 주도 최적화 루프를 제시했다.
- •프롬프트 최적화를 맹목적 탐색이 아닌, 실패한 행동과 인접한 성공 행동을 대조해 고치는 디버깅으로 재구성
- •오류 고정 행동 슬라이스 식별 + 인접 성공 예시 추가 + Teacher LLM 표적 수정, 검증 개선 시만 채택
- •HotpotQA에서 단일 대조 수리로 보류셋 Exact-Match 51.4%→60.4% 향상
- •MIPROv2 59.4%·GEPA 57.0%에 근접, Agent4IR@KDD 2026 발표 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Contrastive Reflection for Iterative Prompt Optimization
- 1.Contrastive Reflection 제안: 실패 사례와 근접 성공 사례를 대조해 Teacher LLM이 프롬프트를 수선
- 2.프롬프트 최적화를 블라인드 탐색이 아닌 '디버깅' 관점으로 재정의, 검증 개선 시에만 수정 채택
- 3.HotpotQA RAG-QA에서 단 1회 대조 수선으로 EM 정확도 51.4%→60.4% 향상
- 4.MIPROv2(59.4%)·GEPA(57.0%) 등 최신 프롬프트 최적화 기법과 동등 이상 성능
왜 중요한가?
실패만 모아 반성시키는 기존 방식과 달리 '가까운 성공'과의 대조로 회귀(regression) 없는 표적 수정을 만든다는 점이 차별점이다. MIPROv2·GEPA급 성능을 내면서도 수정 과정이 검사 가능(inspectable)해, 프로덕션 IR 에이전트의 프롬프트 유지보수에 실용적이다.
본문 미리보기
arXiv:2606.30840v1 Announce Type: new Abstract: LLM agents are becoming central to information retrieval: they issue retrieval queries, synthesize answers, and increasingly serve as judges for IR evaluation. Improving the prompts that control these agents is an optimization problem, but in applied IR settings it often looks less like blind search and more like debugging. Engineers need to know which behavior failed, which nearby behavior still worked, what distinguishes the two, and whether a p
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

