이 논문은 "공정하고 명확하며 오도하지 않을 것" 같은 원칙 기반 규제 기준을 판단하는 LLM 심판을 정확도·패러프레이즈 강건성·적대적 강건성·보정(calibration)의 4축으로 평가해야 한다고 주장한다. 영국 FCA 원칙에 매핑된 168개 암호자산 금융 프로모션 시나리오로 구성된 Principle-Bench와, 예시별 반사실적 근거를 제시하는 보정된 평가자 Ceca를 공개했다. 키워드 카운팅, 3종 임베더, 오픈웨이트 LLM 심판, 보정 캐스케이드를 비교한 결과 4축 모두를 지배하는 방법은 없었으며, 가장 강력했던 120B LLM 심판도 키워드 스터핑 적대적 입력에서 정확도가 0.74에서 0.27로 47%p 급락했다. 규제용 LLM 심판을 배포할 때 종합 정확도뿐 아니라 원칙별 적대적 기만 저항성과 사후 보정을 함께 보고해야 함을 시사한다.
- •원칙 기반 규제용 LLM 심판은 정확도·패러프레이즈 강건성·적대적 강건성·보정 4축으로 평가해야 한다는 포지션 제시.
- •영국 FCA 원칙 매핑 168개 시나리오의 Principle-Bench와 반사실적 근거 제공 평가자 Ceca 공개.
- •120B LLM 심판은 키워드 스터핑 공격에서 정확도가 0.74→0.27로 47%p 급락.
- •서로 다른 모델 간 심판 일치도(Cohen's kappa)가 0.16에 불과해 실패가 모델 특이적임을 확인.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation
- 1.원칙기반 규제 판단(LLM-as-judge)을 정확성·패러프레이즈 강건성·적대적 강건성·캘리브레이션 4축으로 평가해야 함을 주장
- 2.영국 FCA 원칙 2개 매핑 168개 시나리오 벤치마크 Principle-Bench 공개, 4축 모두 다루는 최초 사례
- 3.정확한 예시별 반사실 귀속을 제공하는 캘리브레이션 평가기 Ceca(Calibrated Exemplar-Cluster Assessment) 도입
- 4.120B LLM판사가 정상입력 정확도 0.74에서 키워드스터핑 입력 0.27로 급낙, 판사간 합치도 카파 0.16
왜 중요한가?
규제 준수 여부를 LLM에 판정시키는 관행이 확산되는 가운데, 적대적 조작만으로 판정 정확도가 급락하고 판사 모델 간 일치도도 낮다는 것을 실증해 배포 전 다축 평가와 사후 캘리브레이션 보고를 의무화해야 함을 보여준다.
언급 프로젝트
한국은 AI 윤리 및 규제 정립에 적극적이며, 특히 '공정하고 명확하며 오해의 소지가 없어야 한다'와 같은 원칙 기반 규제에서 LLM의 판단 신뢰성은 핵심 쟁점입니다. 이 연구는 LLM을 '판사'로 활용할 때의 신뢰성을 평가하는 4가지 축 벤치마크를 제시하여, 국내 AI 규제 당국과 기업들이 책임감 있는 AI 시스템을 구축하는 데 중요한 기준점을 제공합니다. 이는 AI 기반 의사결정의 투명성과 공정성을 확보하는 데 필수적입니다.
본문 미리보기
arXiv:2608.14329v1 Announce Type: new Abstract: Principle-based regulation, with evaluative standards such as "fair, clear, and not misleading" or "deliver good outcomes", cannot be reduced to binary predicates, and LLM-as-judge is increasingly used as the substitute. Our position is that any such judge must be evaluated on four axes: accuracy, paraphrase robustness, adversarial robustness, and calibration. We release Principle-Bench, 168 cryptoasset financial-promotion scenarios mapped to two
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:23AI 초안



