AI 정렬 평가가 모델 수준에 편중되어 있어 실제 배포 수준의 정렬을 추론하기 어렵다고 지적하는 논문이다. 16개 정렬 벤치마크 감사 결과 사용자 대면 검증 지원이 전무하고, 동일한 검증 스캐폴드가 모델마다 상이한 효과를 보여 스캐폴드 효과가 모델 의존적임을 보였다. 저자들은 단일 점수 대신 정렬 프로필, 고정 스캐폴딩 프로토콜, 평가 증거와 배포 주장 간 추론 거리를 명시한 보고 템플릿을 제안한다.
- •정렬 주장은 모델·응답·상호작용·배포 수준 중 증거가 수집된 수준에 맞게 인덱싱되어야 한다.
- •16개 벤치마크 감사에서 사용자 대면 검증 지원은 전무했고 프로세스 조종 가능성도 거의 없었다.
- •같은 검증 스캐폴드가 한 모델에서는 검증 지원을 최상으로 높이지만 다른 모델에서는 전혀 영향을 주지 않았다.
- •저자들은 정렬 프로필, 고정 스캐폴딩 프로토콜, 배포 주장과 평가 증거 간 추론 거리 명시 보고 템플릿을 제안한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone
- 1.모델 수준 평가만으로는 배포 관련 정렬을 추론할 수 없다는 주장 제기
- 2.11개 정렬 벤치마크 감사: 사용자 대면 검증 지원이 모든 벤치마크에서 상실됨
- 3.동일한 평가 스캤폴드가 모델에 따라 효과가 완전히 다름을 실증
- 4.정렬 프로파일, 고정 스케폴딩 프로토콜, 배포 주장의 추론 거리 모두 명시하는 평가 어젬다 제안
왜 중요한가?
AI 안전 평가가 실제 배포 환경을 반영하지 못한다는 구조적 문제를 지적하며, 신뢰할 수 있는 시스템 수준 평가 체계 구축의 필요성을 촉구한다.
본문 미리보기
arXiv:2605.04454v1 Announce Type: new Abstract: Alignment evaluation in machine learning has largely become evaluation of models. Influential benchmarks score model outputs under fixed inputs, such as truthfulness, instruction following, or pairwise preference, and these scores are often used to support claims about deployed alignment. This paper argues that deployment-relevant alignment cannot be inferred from model-level evaluation alone. Alignment claims should instead be indexed to the leve
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

