최신 비전-언어모델(VLM)은 이미지 기반 질문에 직접 답할 수 있지만 세밀한 시각적 디테일이나 외부 지식이 필요한 복잡한 질의에는 어려움을 겪는다. 에이전틱 VLM은 이미지 자르기·이미지 검색·텍스트 검색 같은 도구를 호출해 부족한 증거를 확보하지만, 기존 학습 방식은 최종 답변 정확도만으로 도구 사용을 평가해 증거 수집과 활용 과정이 충분히 감독되지 않았다. 이로 인해 모델이 불필요한 도구 호출을 자주 하고, 적절한 도구를 호출하고도 결과에서 필요한 정보를 추출하지 못하는 문제가 발생한다. 연구진은 각 질의에 필수적인 외부 증거와 대응 도구 호출을 명시하는 주석 체계 NTEP를 도입하고, 각 도구 호출이 최종 해결로 추론을 진전시키도록 보장하는 보상 메커니즘 NTEP-R을 제안했다. 충족된 목표를 반복 방문하는 중복 호출을 벌하는 비반복 목표 정규화도 도입했다. 7개 이미지 기반 벤치마크 실험에서 80억 매개변수 모델 NTEP-8B는 검색 지향 정확도와 도구 사용 효율을 통합 3도구 프레임워크 내에서 크게 개선했다.
- •에이전틱 VLM의 도구 사용을 세밀하게 감독하는 필수 도구-증거 경로 주석 체계 NTEP 제안
- •각 도구 호출이 최종 해결로 추론을 진전시키도록 보장하는 보상 메커니즘 NTEP-R 도입
- •충족된 목표를 반복 방문하는 중복 도구 호출을 벌하는 비반복 목표 정규화 설계
- •기존 방식은 불필요한 도구 호출과 결과 정보 미추출이라는 두 가지 문제를 안고 있었음을 지적
- •80억 매개변수 NTEP-8B가 7개 이미지 기반 벤치마크에서 검색 정확도·도구 효율 모두 크게 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
- 1.NTEP는 비전-언어 에이전트의 도구 호출마다 필요한 근거와 대응 툴을 명시하는 주석 체계
- 2.NTEP-R 보상 메커니즘으로 도구 호출 의도와 관찰 결과 요약이 필요한 증거와 일치하도록 학습
- 3.중복 도구 호출을 억제하는 non-repeated-goal 정규화 항목 추가
- 4.8B 파라미터 NTEP-8B가 7개 이미지 기반 벤치마크에서 검색 정확도와 도구 사용 효율을 동시에 개선
왜 중요한가?
기존 도구 사용 에이전트 학습이 최종 정답만으로 평가돼 불필요하거나 부정확한 도구 호출을 방치했던 문제를 해결, 에이전트형 VLM의 신뢰성과 효율을 함께 높이는 구체적 학습 신호를 제공한다.
본문 미리보기
arXiv:2609.03493v1 Announce Type: new Abstract: Modern vision-language models (VLMs) can directly answer many image-grounded questions, yet they often struggle with complex queries requiring fine-grained visual details or external knowledge. To acquire this missing evidence, agentic VLMs invoke tools such as image cropping, image search, and text search. However, existing training paradigms primarily evaluate tool-use based on final answer correctness, leaving evidence acquisition and utilizati
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
