구조화된 도구 호출이 스키마를 조금만 위반해도 실패하는 문제를 겨냥해, JSON 전체를 재생성하지 않고 국소적으로 수정하는 ContractRL을 제안했다. 매 단계마다 정책이 후보 JSON, 검증기 피드백, 수정 이력을 관찰하고, 계약에서 파생된 행동 마스크가 잘못된 연산을 사전에 걸러낸다. 192개 사례 평가에서 ContractRL은 34.4개 토큰만으로 0.9362의 의미적 성공률을 달성해 Patch-SFT(44.9토큰, 0.9076)와 전체 재생성(137.2토큰, 0.9148)을 모두 능가했으며, 정책 최적화로 성공률을 0.9375까지 끌어올렸다. 적은 토큰으로 더 정확한 수정이 가능해 에이전트 시스템의 도구 호출 오류 복구 비용을 크게 줄일 수 있는 실용적 접근이다.
- •JSON 전체 재생성 없이 국소 수정만으로 스키마 위반을 고치는 ContractRL 제안, RFC-6902 연산 기반
- •34.4개 토큰만으로 0.9362 성공률 달성, 전체 재생성(137.2토큰, 0.9148) 대비 적은 토큰으로 더 높은 정확도
- •정책 최적화로 지도학습 버전(0.9186) 대비 성공률을 0.9375까지 끌어올림
- •Patch-SFT와의 통계 비교에서 +0.0396%p(p=0.0039)의 유의한 성능 우위 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair
- 1.ContractRL, 툴 콜 JSON 위반을 토큰 34.4개로 복구해 의미적 성공률 93.62% 달성
- 2.Patch-SFT(90.76%, 44.9토큰)·전체재생성(91.48%, 137.2토큰) 대비 효율·정확도 모두 우위
- 3.정책 최적화로 지도학습 버전(91.86%) 대비 성공률을 93.75%까지 향상
- 4.Patch-SFT 대비 +3.96%p 유의한 차이(p=0.0039), 192건×5시드로 검증
왜 중요한가?
툴 호출 실패를 전체 재생성 없이 적은 토큰으로 정밀 복구함으로써, 에이전트 파이프라인의 비용과 지연을 함께 줄이는 실용적 접근을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2610.00328v1 Announce Type: new Abstract: Structured tool calls often fail after only a small number of fields violate a schema or an execution contract. Regenerating the complete object enlarges the action surface and makes repeated repair difficult to audit. We introduce ContractRL, a contract-constrained sequential repair protocol that models verifier-guided JSON repair as a bounded decision process. At each step the policy observes the candidate, typed verifier feedback, JSON Pointer,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

