배포된 LLM 에이전트의 도구 호출이 조용히 틀릴 수 있는데, 프론티어 모델은 토큰 확률을 숨기고 스스로 밝히는 확신도도 신뢰하기 어려운 문제를 해결하기 위해, 병렬로 실행되는 저비용 오픈웨이트 '대리 모델'의 로그 확률로 신뢰도를 복원하는 기법이 제안됐다. 동일한 맥락·스키마·제안된 행동을 보고 교사 강제·요청별 PMI(인자값 가능도), 판별적 판정(전체 호출 평가), 도구 선택 경쟁(함수 간 비교) 등 상호 보완적인 방식으로 점수를 매기며, 오류 유형을 모를 때는 앙상블이 최선이다. 어려운 코딩 과제에서 이 신호는 AUROC 0.825를 기록해 행위자의 자체 확신도(0.598)를 크게 앞섰고, 자기일관성 대비해서도 1/K 비용으로 +0.14~0.19 향상됐다. 이 신호는 가장 신뢰도 낮은 호출을 검토로 넘기는 실시간 게이트(50% 커버리지에서 정확도 +0.05~0.30)와 결과를 에이전트에 돌려주는 확신도 피드백(실행 성공률 +0.119~0.137)에 활용될 수 있다.
- •병렬 실행되는 저비용 오픈웨이트 대리 모델의 로그 확률로 에이전트 호출의 신뢰도를 복원
- •교사 강제·PMI·판별적 판정·도구 선택 경쟁 등 상호 보완적 판독 방식 결합, 오류 유형 불명 시 앙상블이 최선
- •어려운 코딩 과제에서 AUROC 0.825로 에이전트 자체 확신도(0.598)를 크게 앞서
- •실시간 게이트와 확신도 피드백으로 실제 작업 성공률을 최대 +0.137까지 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities
- 1.배포된 LLM 에이전트의 잘못된 도구 호출을 사전 감지하려, 저비용 오픈 서로게이트 모델의 로그확률로 신뢰도 신호를 복원하는 기법 제안
- 2.teacher forcing, request-PMI, 판별형 평가, 도구 선택 경쟁 등 상호보완적 방식으로 신뢰도 점수화
- 3.어려운 코딩 과제서 AUROC 0.825, 액터 자체 확신도(0.598)보다 최대 +0.28 우수
- 4.자기 일관성 대비 1/K 비용으로 +0.14~0.19 향상, 실시간 게이팅·피드백 결합 시 과제 성공률 최대 +0.137 상승
왜 중요한가?
프런티어 모델 API가 토큰 확률을 숨기는 상황에서도 저비용 서로게이트만으로 '이 도구 호출이 틀렸을 확률'을 실질적으로 추정할 수 있음을 보여줘, 상용 에이전트의 실시간 오류 탐지 비용을 크게 낮출 수 있다.
본문 미리보기
arXiv:2610.03894v1 Announce Type: new Abstract: A deployed LLM agent emits tool calls, queries, and code that can be silently wrong -- by the time the error surfaces, the action has run. Frontier chat APIs hide the model's token probabilities; the agent's stated confidence barely beats chance on the mistakes that matter; and resampling does not help, since frontier models are highly repetitive, reproducing the same call across samples. We recover the missing signal from a low-cost open-weight
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

