상태별 전문가 행동 라벨 없이 지역 수준 진단 피드백만으로 의사결정 정책을 수리하는 에이전틱 AI를 호텔 가격 책정 시뮬레이터에서 검증한 연구다. LLM 편집기는 벤치마크 정책의 행동·코드·보상을 볼 수 없고 시간·재고·시장 구역별 가격 분포 차이 요약만 받는데, 5,000개 홀드아웃 에피소드에서 RevPAR 108.47을 기록해 벤치마크(108.75)에 통계적으로 근접했고 에피소드 구성 거리도 1.153에서 0.609로 줄였다. 비의미적 제안기는 2,500회 평가에도 8.77~14.57점 뒤졌고, 진단을 뒤섞은 대조군은 94.30으로 추락해 LLM이 진단-오류 대응을 실제로 활용함을 확인했다. 다만 트리 편집기는 행동 정렬이 더 좋아도 수익이 98.91로 떨어져, 에이전틱 정책 수리는 단일 행동 거리 지표가 아니라 진단 피드백이 신뢰할 수 있는 폐루프 성과로 이어지는지로 평가해야 한다고 결론짓는다.
- •상태별 전문가 라벨 없이 지역 수준 진단 피드백만으로 정책을 수리하는 평가 설정 설계
- •멀티 재시작 LLM 편집기가 RevPAR 108.47로 벤치마크 108.75에 통계적으로 근접(비벤치마크 수리 중 최고)
- •비의미적 제안기는 8.77~14.57점 열세, 진단 셔플 대조군은 94.30으로 하락해 진단 활용이 진짜임을 입증
- •트리 편집기는 행동 정렬이 좋아도 수익 98.91로 하락: 행동 거리 단일 지표 평가의 함정 경고
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions
- 1.LLM 정책 편집기가 지역별 진단 피드백만으로 벤치마크(108.75)에 근접한 RevPAR 108.47 달성
- 2.전문가 행동 라벨·벤치마크 코드·보상값 없이 제약된 타깃 액션 테이블 편집만으로 정책 수리
- 3.비의미적 탐색 대조군은 2,500회 평가에도 8.8~14.6점 뒤처져 의미적 진단 해석이 핵심임을 입증
- 4.단일 행동 거리 지표가 아니라 진단 피드백이 폐루프 성과로 이어지는지로 평가해야 한다고 주장
왜 중요한가?
전문가 라벨 없이 집계 수준 진단만으로 에이전트가 정책을 수리·감사할 수 있음을 보여, 라벨 확보가 어려운 실무 가격책정·운영 정책 개선에 적용 가능한 평가 방법론을 제시한다. 트리 편집기가 정렬 지표는 좋아도 수익이 떨어진 결과로 단일 행동 거리 지표의 한계도 실증했다.
본문 미리보기
arXiv:2607.03386v1 Announce Type: new Abstract: Agentic AI systems are increasingly used to edit, refine, and repair decision policies, but evaluating these edits is difficult when per-state expert action labels are unavailable. We study this problem in a hotel-pricing simulator where an agentic policy editor receives only region-level diagnostic feedback: summaries of how its price distribution differs from a benchmark policy across time, inventory, and market regions. The editor cannot observ
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

