소형 언어모델(SLM)이 거대 LLM 플래너 주변의 자잘한 업무를 저비용 베이스라인 수준으로 처리할 수 있는지 검증했다. Qwen3 0.6B~8B 모델을 테스트한 결과 16개 구성 중 단 하나도 사전에 정한 신뢰구간 기준을 통과하지 못하는 「적격성 격차」가 확인됐다. 4비트 양자화는 모델 크기에 따라 다른 손상을 주었지만 어떤 구성도 기준을 넘기지 못해, 격차가 정밀도보다 모델 크기와 더 연관됨을 뒷받침했다. 이 결과는 Llama-3.x에서도 재현됐고 프롬프트 변화에도 견고했으며, 실무적으로는 베이스라인이 기준을 못 넘는 경우에만 SLM을 투입하라는 지침을 제시한다(4B 재랭커가 BM25 대비 +0.047 개선).
- •4개 마이크로태스크×4개 Qwen3 모델(0.6B~8B) 중 사전 정의 신뢰구간 기준을 통과한 구성은 0개
- •4비트 양자화는 모델 크기에 따라 다른 손상을 주지만 어떤 구성도 적격성 기준을 넘기지 못함
- •Llama-3.x에서도 동일하게 12/12 부적격으로 재현되며 프롬프트·임계값 변화에도 결과가 견고
- •실무 지침: 베이스라인이 임계값을 못 넘는 경우에만 SLM 투입(예: 4B 재랭커가 BM25 대비 +0.047 개선)
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?
- 1.에이전트의 보조 마이크로태스크(명령승인·메모작성·도구선택)에 소형모델(SLM)이 적합한지 검증
- 2.Qwen3 0.6B~8B 4종 모두 4개 과제 기준선을 통과하지 못함(16개 구성 중 0개 적격)
- 3.4비트 양자화(RTN/GPTQ/AWQ)도 효과 없고 모델크기 의존성이 더 큼—Llama-3.x도 12/12 미적격
- 4.BM25 숏리스트 위에 4B 재랭커를 얹으면 BM25 단독보다 +0.047(95% CI [0.020,0.073]) 개선
왜 중요한가?
에이전트 보조 작업에 저렴한 소형 모델을 쓰면 된다는 가정이 실제로는 기준선 통과에 실패하는 경우가 많다는 것을 보여, SLM 도입 전 신뢰구간 기반 적격성 검증이 필요함을 시사한다.
본문 미리보기
arXiv:2610.00025v1 Announce Type: new Abstract: Agent harnesses increasingly want to run small language models (SLMs) on the microtasks around a frontier large language model (LLM) planner: auto-approving shell commands, writing memory, selecting tools, ranking past turns. We ask whether off-the-shelf SLMs meet practitioner-defined thresholds and, when they fail, why, and whether quantization changes the answer. We build a benchmark of 4 such microtasks with fixed prompts and automatic metrics,
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

