24GB 노트북에서 4B 모델로 돌아가는 온디바이스 리서치 에이전트의 인용 충실성을 결정하는 요인을 분리해낸 연구다. 보통 하나로 묶여 보고되는 두 지표—인용된 출처가 주장을 실제로 뒷받침하는가(인용 충실성)와 올바른 출처를 인용했는가(신뢰 커버리지)—를 분리하고, 출처당 노출량(400자 vs 1,500자)과 출처 품질(골드 논문 vs 검색 논문)을 교차 실험했다. 결과: 노출이 충실성을 결정한다. 출처를 더 많이 보여주면 충실성이 검색 출처에서 0.45→0.58, 골드 출처에서 0.37→0.58로 올라 두 조건이 수렴했다. 반면 커버리지는 검색이 결정한다. 검색 재현율이 0.40 근처에 묶여 있어 노출을 늘려도 커버리지는 0.22 부근에 머물렀다. 추가 노출 비용은 출력 약 235토큰에 불과해, 싼 노출 증대를 먼저 적용하고 검색 재현율을 유일한 남은 레버로 다루라는 실용 처방을 제시한다.
- •인용 평가를 '인용 주장 충실성'과 '신뢰 커버리지'로 분리한 4B 온디바이스 에이전트 연구
- •출처당 노출 400→1,500자로 충실성 0.45→0.58(검색), 0.37→0.58(골드) — 충실성은 노출이 상한
- •검색 재현율이 약 0.40에 묶여 커버리지는 노출과 무관하게 0.22 부근 정체
- •추가 노출 비용은 출력 약 235토큰 — 싼 노출 증대 먼저, 그 다음 검색 개선이라는 처방
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage
- 1.24GB 노트북·4B 모델 온디바이스 리서치 에이전트의 인용 충실성 결정 요인 분석
- 2.소스 노출량이 충실성 결정: 400→1500자 확대 시 충실성 0.45→0.58(검색 소스)
- 3.신뢰 커버리지는 검색 재현율(약 0.40)에 묶여 0.22 수준, 노출 확대로 개선 불가
- 4.처방: 소스당 노출부터 즍리고(추가 약 235토큰), 이후 검색 재현율만 남은 레버
왜 중요한가?
인용 품질을 '인용된 주장의 충실성'과 '올바른 소스 커버리지'로 분리해 각각 노출량과 검색이라는 서로 다른 레버에 지배됨을 보였다. 온디바이스 소형 리서치 에이전트를 튜닝할 때 무엇부터 고칠지에 대한 저비용 실용 우선순위를 제시한다.
개인 노트북에서 4B 규모의 온디바이스 AI 모델이 연구 작업을 수행할 때 인용의 충실도와 정보 검색의 커버리지를 분석합니다. 온디바이스 AI 기술의 효율성과 개인 정보 보호 기능에 대한 관심이 높은 한국 시장에서, 소형 모델의 실제 성능과 한계를 파악하는 것은 실용적인 AI 솔루션 개발에 중요한 통찰을 제공할 것입니다.
본문 미리보기
arXiv:2607.12257v1 Announce Type: new Abstract: On-device research agents search a corpus, read sources, and write a cited brief on a personal laptop. Whether their citations are faithful, and at what cost, is unmeasured for a deployable small model. This study fixes one 4B generator on a 24 GB laptop and asks what makes its citations faithful. It separates two quantities usually reported as one number. Cited claim faithfulness asks whether the cited source supports the claim. Trustworthy cover
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:40AI 초안

