프로덕션 멀티모달 비디오 에이전트 하네스 Tinycloud의 사례를 통해, 스킬 라이브러리가 커질 때 플래너가 올바른 스킬을 선택하는 방식을 분석한 연구다. 툴-스킬(단일 외부 API·도구 래핑)과 워크플로-스킬(툴-스킬 호출과 템플릿 렌더링 조합)이라는 두 표현 방식을 인라인 본문과 한 줄 목록 두 노출 방식으로 시스템 프롬프트에 제공한다. 전부-켬, 기본값, 전부-끔 세 노출 체제로 6개 과제를 실험한 결과, 전부-켬은 매번 정답 스킬을 선택했지만 전부-끔은 실행이 느려지고 탐색 실패가 발생했으며, 기본값은 어휘적 신호 충돌로 한 과제에서 잘못된 스킬을 선택했다. 스킬 노출을 늘리는 것이 항상 도움이 되지는 않으며, 부분적 노출이 오히려 어휘 경쟁을 유발할 수 있음을 보여준다.
- •Tinycloud 프로덕션 멀티모달 비디오 에이전트를 사례로 스킬 선택 메커니즘 분석
- •툴-스킬과 워크플로-스킬 두 표현 방식을 인라인/한줄 목록 두 노출 방식으로 제공
- •전부-켬/기본값/전부-끔 세 노출 체제에서 6개 과제 실험
- •전부-켬은 항상 정답 선택, 전부-끔은 느려지고 탐색 실패, 기본값은 어휘 충돌로 오선택 발생
- •스킬 노출 확대가 항상 유리하지 않으며 부분 노출이 어휘 경쟁을 유발할 수 있음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness
- 1.Tinycloud 프로덕션 에이전트에서 스킬 노출 방식이 선택 정확도를 좌우한다는 사실 확인
- 2.전체 자동로드(all-on) 시 6개 과제 모두 정답 스킬 선택, all-off는 탐색 실패 유발
- 3.실제 운영 중인 default 설정은 한 과제에서 어휘 충돌로 오라우팅 발생
- 4.부분 노출이 어휘적 경쟁을 유발해 오히려 스킬 선택을 방해할 수 있음을 규명
왜 중요한가?
스킬을 시스템 프롬프트에 얼마나·어떻게 노출할지가 에이전트 신뢰성에 직접 영향을 미친다는 실증 사례로, 대규모 임베딩 기반 검색 이전 소규모 에이전트 설계에 실무적 시사점을 준다.
언급 프로젝트
본문 미리보기
arXiv:2608.20389v1 Announce Type: new Abstract: A production agent harness must discover and rank, from a growing library of skills, the one most appropriate for a user's task. At small scale this selection happens in context: the LLM planner chooses among skill representations exposed in its system prompt, without an explicit embedding-based retrieval step. We treat this in-context selection as the small-N counterpart to embedding-based skill retrieval at scale, and present a case study of how
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
