이 논문은 상업용 LLM API가 광고한 모델과 실제 서빙되는 모델이 몰래 교체·양자화·래핑됐는지를 감사하는 새로운 방법 'AgentProv'를 제안한다. 기존 감사 기법은 텍스트 출력 채널에 의존해 도구 호출 시 텍스트를 생략하는 에이전트형 API(OpenAI, Anthropic, Gemini 등)에서는 취약하고, 제공자가 삽입한 시스템 프롬프트가 텍스트 분포를 왜곡해 정직한 제공자를 오탐하는 문제가 있었다. AgentProv는 대신 모델 가중치에 내재화된 도구 호출 패턴(범주형 도구 호출 분포)을 지문으로 삼아 MMD 순열검정으로 신원을 판별하는 최초의 행동 기반 감사 기법이다. 630개의 체크포인트 쌍 평가에서 교체된 모델을 100% 탐지했고, 시스템 프롬프트 주입 상황에서도 위양성률을 7%로 억제해 기존 기법(MET 67%, RUT 53%)보다 크게 우수했다.
- •AgentProv, LLM API의 실제 서빙 모델 교체·양자화 여부를 감사하는 최초의 행동(도구호출) 기반 기법
- •도구 호출 범주형 분포를 지문으로 삼아 MMD 순열검정으로 모델 신원 판별
- •630개 체크포인트 쌍 평가에서 교체 모델 탐지율 100% 달성
- •시스템 프롬프트 주입 상황에서 위양성률 7%로 기존 기법(MET 67%, RUT 53%) 대비 대폭 개선
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes
- 1.에이전트형 LLM API의 실제 서빙 모델 정체성을 도구호출 분포 기반으로 감사하는 AgentProv 제안
- 2.630개 체크포인트 쌍에서 교체된 모델을 100% 탐지, 시스템프롬프트 주입 하 오탐률은 7%(MET 67%·RUT 53% 대비 우수)
- 3.OpenAI·Anthropic·Gemini 등 최신 서빙스택이 텍스트출력 대신 구조화된 액션만 노출하는 문제를 도구호출 채널로 최초 우회
왜 중요한가?
상용 LLM API가 광고된 모델을 몰래 양자화·교체해도 기존 텍스트출력 기반 감사로는 탐지가 어려웠던 사각지대를 도구호출 채널로 메워, API 제공자의 투명성 검증에 실질적 수단을 제공한다.
본문 미리보기
arXiv:2609.00052v1 Announce Type: new Abstract: Commercial LLM APIs advertise a specific foundation model, but the served backbone may be silently substituted, quantized, or wrapped, for example to save deployment costs. All existing audits decide backbone identity from the text-output channel, which is structurally fragile for agentic APIs because modern serving stacks (OpenAI, Anthropic, Gemini, Cloudflare Workers AI, LangGraph) discard text and expose only structured actions when the model c
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
