SAAG는 에이전트 함수 호출 평가를 레지스트리 적합성, 구조적 완전성, 인자 근거(grounding)의 3단계로 분해하는 캐스케이드 진단 프레임워크다. 기존 벤치마크는 올바른 함수를 고르고도 인자 값을 환각하는 경우와 스키마만 맞춘 잘못된 선택을 하나의 이진 점수로 뭉뚱그려 실패 원인 진단이 불가능했다. 단계별 진단 신호는 정답 유출 없이 표적 수정(self-repair)을 유도하며, Glaive 함수 호출 데이터셋 기반 벤치마크에서 4B 미만 로컬 모델 3종, 레지스트리 크기 5·10·15로 검증했다. 구조화된 피드백은 단일 패스 추론이나 이진 피드백 대비 인자 정밀도를 일관되게 높이고 값 환각을 줄였지만, 엔드투엔드 F1 향상은 제한적이고 모델 의존적이었다. 에이전트 호출 신뢰성을 진단·개선하려면 단계 분해형 평가가 필요함을 시사한다.
- •에이전트 호출 평가를 레지스트리 적합성·구조적 완전성·인자 근거의 3단계로 분해해 실패 모드를 구분 진단
- •단계별 진단 신호로 정답 값 유출 없이 반복적 자가 수정(self-repair) 가능
- •Glaive 함수 호출 데이터셋 기반, 4B 미만 로컬 모델 3종과 레지스트리 크기 5·10·15에서 평가
- •구조화된 피드백이 인자 정밀도를 높이고 값 환각을 감소시켰으나 엔드투엔드 F1 향상은 모델 의존적으로 제한적
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
SAAG: Structured Agent Assessment and Grounding
- 1.SAAG 제안: 에이전트 호출 평가를 레지스트리 적합·구조 완전성·인수 근거의 3단계로 분해
- 2.단계별 진단 신호로 정답 유출 없이 표적 자가 수정(self-repair) 가능
- 3.Glaive 데이터셋 기반, 4B 미만 로컬 모델 3종·레지스트리 5~15개 규모로 평가
- 4.구조화 피드백이 인수 정밀도 개선·값 환각 감소, 다만 종단 F1 이득은 모델 의존적
왜 중요한가?
이진 exact-match 점수로는 '함수는 맞았는데 인수를 지어낸' 실패와 '스키마만 통과한' 실패를 구분할 수 없다는 실무 진단 공백을 겨냥했다. 소형 로컬 모델 기반 툴콜링 시스템의 디버깅에 바로 쓸 수 있는 평가 렌즈다.
AI 에이전트의 구조화된 평가 및 접지(grounding)를 제안하는 이 연구는 에이전트의 미묘한 실패 모드를 정확히 파악하는 데 중점을 둡니다. 한국에서 자율 AI 에이전트 개발이 가속화되는 가운데, 신뢰할 수 있고 안전한 에이전트를 구축하기 위해서는 이러한 정교한 평가 방법론이 필수적입니다. 이는 국내 AI 에이전트 기술의 완성도를 높이는 데 기여할 것입니다.
본문 미리보기
arXiv:2607.18245v1 Announce Type: new Abstract: Exact-match evaluation of agent-calling obscures qualitatively different failure modes: a model may select the right function yet hallucinate argument values, or satisfy a schema while choosing a agent for the wrong reason. Existing benchmarks collapse these distinctions into a single binary score, leaving practitioners unable to diagnose where agent calls fail. We propose SAAG a cascaded diagnostic framework that decomposes agent-calling evaluati
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

