이 연구는 루프형(looped) 언어모델이 추론 벤치마크에서 좋은 성과를 보였지만 에이전틱 도구 사용 능력은 거의 탐구되지 않았다는 점에 착안해, 여러 API 호출을 조율하고 중간 상태를 유지하며 도구 간 의존성을 보존해야 하는 조합적 도구 호출 상황에서 이를 검증했다. API-Bank, BFCL, NESTful 벤치마크에서 네이티브 및 개조된 루프형 언어모델을 동일한 지도 미세조정 레시피로 학습한 비루프형 모델과 비교하고, 추론 시점의 순환 깊이를 조절하며 실험했다. 그 결과 순환 연산은 조합적이고 의존성 인식이 필요한 도구 사용에는 대체로 도움이 됐지만 단일 API 호출에서는 이득이 더 작고 모델별 편차가 컸다. 다단계 도구 사용 정확도는 순환 깊이가 커질수록 대체로 향상됐으며, 적응형 추론은 필요할 때만 추가 연산을 배분해 더 유리한 연산-성능 트레이드오프를 달성했다. 이는 루프형 언어모델이 신뢰할 수 있는 계획·조율·실행이 필요한 에이전틱 시스템에 유망한 아키텍처임을 시사한다.
- •루프형 언어모델의 에이전틱 도구 사용 능력을 API-Bank, BFCL, NESTful로 검증
- •순환 연산은 조합적·의존성 인식 도구 사용에 도움, 단일 API 호출 이득은 더 작고 모델별 편차 큼
- •다단계 도구 사용 정확도는 순환 깊이 증가에 따라 대체로 향상
- •적응형 추론이 필요한 만큼만 연산을 배분해 더 나은 연산-성능 트레이드오프 달성
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Looped Language Models Improve Compositional Tool Calling
- 1.루프형(loop) 언어모델의 복합 도구 호출 성능을 API-Bank·BFCL·NESTful 3개 벤치마크로 평가
- 2.다단계 API 조율·상태 유지가 필요한 복합 작업에서 순환 연산(recurrent computation)이 성능 향상에 기여함을 확인
- 3.단일 API 호출에서는 이득이 작고 모델별 편차가 컸으며, 적응형 추론이 고정 깊이보다 연산 대비 효율이 더 좋음
왜 중요한가?
다중 도구 호출을 조율해야 하는 에이전트 시스템에서, 무작정 반복 연산을 늘리기보다 필요할 때만 추가 연산을 배분하는 적응형 방식이 더 실용적임을 실험으로 보여준다.
본문 미리보기
arXiv:2608.18171v1 Announce Type: new Abstract: Looped language models have shown promising results on reasoning benchmarks, yet their potential for agentic tool use remains largely unexplored. We study this question in compositional tool-calling settings, where models must coordinate multiple API calls, maintain intermediate state, and preserve dependencies across tool interactions. We evaluate native and retrofitted looped language models on API-Bank, BFCL, and NESTful, comparing looped and n
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
