연구진은 LLM 에이전트가 도구를 실제로 호출하기 전에 가능한 다음 호출의 장기적 가치를 미리 추정해야 한다고 주장하며, 비교 추론 기반 도구 사용 에이전트 기법 'CITA'를 제안했다. CITA는 관찰된 도구 사용 기록, 베이지안 도구 그래프 시뮬레이터의 확장 가능한 감독 신호, LLM 기반 의미적 비교 판단을 결합한 쌍별(paired) 신호로 비교 추론 모델(CIM)을 학습시켜, 동일한 맥락에서 여러 후보 호출 중 어느 것이 최종 과제 성공에 더 기여할지 비교하도록 한다. 세 가지 도구 사용 벤치마크와 다수의 백본 LLM에서 실험한 결과 CITA는 Tool F1과 과제 성공률을 일관되게 향상시켰으며, CIM이 정확한 단계별 가치 추정을 학습한다는 분석도 확인됐다.
- •최종 결과 보상만으로는 긴 도구 호출 과정에 대한 신용 할당이 약하다는 문제를 지적
- •관찰 기록·베이지안 도구 그래프 시뮬레이터·LLM 비교 판단을 결합한 쌍별 신호로 CIM 학습
- •동일 맥락에서 다음 도구 호출들의 장기 성공 기여도를 사전에 비교 추정
- •3개 벤치마크·여러 백본 LLM에서 Tool F1과 과제 성공률 일관되게 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents
- 1.CITA는 다음 툴을 실행하기 전에 그 선택이 최종 성공에 얼마나 도움이 될지 먼저 추정하는 방법
- 2.실제 로그에는 선택된 툴만 남는 한계를 베이지안 툴-그래프 시뮬레이터와 LLM 비교 판단으로 보완
- 3.이렇게 학습한 비교추론모델(CIM)이 대안 툴 선택에 대해서도 정확한 단계별 가치 추정을 학습함을 확인
- 4.3개의 툴 사용 벤치마크와 여러 백본 LLM에서 Tool F1과 작업 성공률을 일관되게 개선
왜 중요한가?
에이전트가 긴 툴 호출 사슬에서 마지막 결과만으로 보상을 받아 중간 선택의 좋고 나쁨을 구분하지 못하던 문제를, 실행 전 비교 평가로 해결하는 실용적인 접근이다.
언급 프로젝트
본문 미리보기
arXiv:2610.02330v1 Announce Type: new Abstract: Large language models (LLMs) rely on long-horizon tool invocation sequences for complex tasks, where each invocation can alter the task state and condition subsequent decisions. In long-horizon tool use, final-outcome rewards provide weak credit assignment over long interaction traces. Step-level rewards can offer more targeted feedback, but obtaining reliable step supervision often requires human or LLM judgment, or additional rollouts to estimat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

