정책 분석은 법안 통과 여부 예측을 넘어 누가 영향을 받고 그 행위자들이 어떻게 반응하며 무엇이 뒤따르는지를 파악해야 한다. LLM 기반 정책 시뮬레이션은 이를 대규모로 모델링하지만, 그럴듯한 행동을 실제 관찰된 결과와 비교하지 않으면 타당성을 검증하기 어렵다. 연구진은 입법 기록, 로비 공시, 규제 문서, 기업 공시, 경제 데이터 등 공개 증거를 바탕으로 정책과 행위자·행위·후속 영향을 연결하는 근거 기반 벤치마크 'GPS-Bench'를 제안한다. 행위자는 원형이 아니라 날짜가 명시된 기록에서 재구성돼 출처가 있는 증거 객체로 취급되며, 하나의 정책 상태에 대해 공동 추론, 독립·소통형 에이전트, 그래프 기반 방법, 가중치 미세조정을 통제 비교했다. 근거 기록에 대한 미세조정이 행위자 수준 영향 예측에서 가장 우수했고, 다중 에이전트 분해는 이를 능가하지 못했지만 메커니즘 해석력을 더해줬다.
- •정책 시뮬레이션의 타당성을 실제 관찰된 결과와 비교해 검증하는 근거 기반 벤치마크 GPS-Bench 제안
- •행위자를 원형이 아닌 날짜 기록에서 재구성한 출처 있는 증거 객체로 취급
- •공동 추론, 독립·소통형 에이전트, 그래프 기반 방법, 가중치 미세조정을 통제 비교
- •근거 기록 미세조정이 행위자 수준 영향 예측에서 가장 강력, 다중 에이전트 분해는 이를 능가하지 못함
- •다중 에이전트는 각자 다른 증거를 보고 구체적 공동 제안을 교환해 연합 형성 메커니즘을 검증 가능하게 함
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis
- 1.GPS-Bench는 입법기록·로비공시·규제문서 등 실증 데이터로 정책 시뮬레이션을 검증하는 벤치마크
- 2.액터를 프롬프트 아키타입이 아닌 실제 기록에서 재구성, Gold(사람평가)·Silver(LLM라벨) 데이터셋으로 구분
- 3.단일 정책 상태에 대해 공동추론·독립/소통 에이전트·그래프 기반·파인튜닝 방식을 통제 비교
- 4.그라운드된 기록으로 파인튜닝한 모델이 액터별 영향 예측에서 가장 우수, 분해 기법은 정확도 대신 메커니즘 해석력 제공
왜 중요한가?
정책 시뮬레이션에 LLM을 쓸 때 그럴듯함과 실제 타당성을 구분할 근거가 부재했는데, 실제 관측 결과와 대조 가능한 벤치마크를 제공해 거버넌스 분석 AI 도구의 신뢰성 검증 기준을 세운다.
언급 프로젝트
본문 미리보기
arXiv:2609.03553v1 Announce Type: new Abstract: Policy analysis requires more than predicting whether a proposal will pass: it requires identifying who will be affected, how those actors respond, and what follows. LLM-based policy simulations model these processes at scale, but their validity is hard to establish when plausible behaviour is never compared with observed outcomes. We introduce GPS-Bench, an evidence-grounded benchmark for governance policy simulation that links policies to releva
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
