연구진은 오픈웨이트 모델 Laya와 호스팅 모델 Jev라는 두 System-1 의사결정 모델을 18개 공개 소스에서 구축한 11개 에이전트 의사결정 지점, 총 7,283개 기본 사례와 6,640개 견고성 변형 사례로 쌍별 평가했다. Jev는 11개 지점 중 9개에서 유의하게 더 정확했고(+10.8~+46.0퍼센트포인트) 두 모델 모두 제로샷 모델 라우팅에서는 우연 수준을 넘지 못했으며 RAG 관련성 게이팅에서는 동률이었다. 특히 Laya는 선택지 순서를 뒤집으면 답의 30%가 바뀌고 후보가 많거나 유사할 때 성능이 급격히 떨어졌다(50개 최근접 도구 상황에서 31%, 같은 조건에서 Jev는 98%). 연구진은 자체 분석 파이프라인도 감사해 사전 스크리닝 비용 누락(보고된 23.9% 절감이 실제 4.3%), 게이트 정확도를 종단 품질로 보고(58% 대 98%) 등 세 가지 분석 오류와 한 가지 설계 혼란 요인이 배포 성과를 과장했음을 확인했다.
- •오픈웨이트 Laya와 호스팅 Jev를 11개 에이전트 의사결정 지점·13,923개 사례로 쌍별 비교 평가
- •Jev가 9/11 지점에서 유의하게 우세, 제로샷 모델 라우팅은 두 모델 모두 우연 수준
- •Laya는 선택지 순서 반전 시 답의 30% 변경, 후보 50개 상황에서 정확도 31%(Jev는 98%)로 급락
- •자체 파이프라인 감사로 사전 스크리닝 비용 누락 등 분석 오류 3건이 배포 성과(23.9%→실제 4.3% 절감)를 과장했음을 발견
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
- 1.오픈웨이트 Laya와 호스팅형 Jev, 두 시스템-1 결정 모델을 11개 에이전트 판단 지점에서 나란히 평가
- 2.Jev가 11개 중 9개 지점에서 10.8~46.0%포인트 더 정확했고, 제로샷 모델 라우팅은 둘 다 운에 가까운 성능
- 3.선택지 순서를 뒤집자 Laya는 답의 30%가 바뀌었고, 후보가 50개로 늘면 정확도가 31%까지 떨어짐(Jev는 98%)
- 4.자체 파이프라인을 감사해 '23.9% 비용 절감'이라던 주장이 실제로는 4.3%에 불과했음을 발견
왜 중요한가?
빠르고 저렴하다고 알려진 경량 판단 모델도 과제에 따라 신뢰도가 크게 갈리고, 배포 성과 보고 자체에도 분석 오류가 숨어 있을 수 있다는 점을 자체 감사로 드러낸 드문 사례다.
본문 미리보기
arXiv:2610.02267v1 Announce Type: new Abstract: Agent harnesses make many small, typed decisions per task: which model to call, which tool to use, whether retrieved text is relevant, whether an input carries an injection. System-1 decision models answer such questions in a single forward pass with class probabilities, promising large cost and latency savings over LLM calls. We present a paired evaluation of an open-weight (Laya) and a hosted (Jev) System-1 model on 11 agent decision points buil
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

