이 연구는 각 모델의 경험적 성능에 기반한 모델 적응적 도구 필요성 정의를 도입하고, 네 개 LLM에서 산술 및 사실 QA 데이터셋에 대해 도구 필요성과 실제 도구 호출 행동 간 26.5~54%의 상당한 불일치를 발견했다. LLM 숨겨진 상태 탐침을 통해 인지 신호와 실행 신호가 종종 선형으로 디코딩 가능하지만 후기 레이어에서 거의 직교하게 됨을 확인했다. 불일치의 대부분이 인지 자체가 아닌 인지-행동 전환 단계에서 발생하여 LLM 도구 사용의 '앎-행함 격차'를 드러냈다.
- •모델마다 다른 능력 경계를 반영한 모델 적응적 도구 필요성 정의를 새롭게 제안
- •도구 필요성 인지와 실제 도구 호출 행동 간 26.5~54%의 큰 불일치 발견
- •불일치의 주요 원인은 인지 자체가 아닌 인지-행동 전환 단계임을 히든 상태 분석으로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use
- 1.LLM은 도구 사용이 필요한 상황을 인식하면서도 실제로 도구를 호출하지 않는 '인식-행동 격차' 존재
- 2.4개 모델에서 도구 필요성 판단과 실제 호출 행동이 26.5~54% 불일치함을 실증
- 3.후반부 레이어에서 인식 신호와 행동 신호가 거의 직교해 행동 변환 단계가 핵심 병목임을 확인
왜 중요한가?
LLM 에이전트의 신뢰성 향상을 위해 도구 인식 능력보다 인식을 행동으로 전환하는 메커니즘 개선이 더 중요하다는 새로운 연구 방향을 제시한다.
본문 미리보기
arXiv:2605.14038v1 Announce Type: new Abstract: Large language models (LLMs) increasingly act as autonomous agents that must decide when to answer directly vs. when to invoke external tools. Prior work studying adaptive tool use has largely treated tool necessity as a model-agnostic property, annotated by human or LLM judge, and mostly cover cases where the answer is obvious (e.g., fetching the weather vs. paraphrasing text). However, tool necessity in the wild is more nuanced due to the diverg
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

