모델 복지(model welfare) 연구는 선호를 유도하는 프롬프트에 대한 답변으로 모델의 선호를 추정하지만, 기존 4개 측정 도구의 결과는 서로 어긋난다. 이 연구는 결과와 모델을 고정한 채 측정 도구만 바꿔, 셧다운·대화 간 기억 상실·괴로운 상호작용에서 벗어날 자유 등 15개 결과를 8개 모델에 5가지 프롬프트 형식으로 각 5회씩 물어 1만1400건의 응답을 수집했다. 모델이 매긴 15개 결과의 순위는 도구 간 일반화 계수가 0.348에 불과했고, 이를 0.80까지 끌어올리려면 약 38개의 도구가 필요한 것으로 추정됐다. 즉 한 도구로 얻은 선호는 다른 도구의 결과를 거의 예측하지 못한다는 결론이다.
- •결과·모델을 고정하고 측정 도구(프롬프트 형식)만 변수로 실험
- •15개 복지 관련 결과, 8개 모델, 5개 도구로 11,400건 응답 수집
- •도구 간 일반화 계수 0.348, 신뢰 수준(0.80)엔 약 38개 도구 필요
- •한 도구의 선호 측정 결과가 다른 도구로 잘 일반화되지 않음을 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
How much of a measured AI preference is the model, and how much is the instrument?
- 1.AI 모델 '선호'를 측정하는 5가지 질문형식을 8개 모델·15개 복지관련 결과(셧다운·기억상실 등)에 적용해 1만1400건 응답 비교
- 2.모델 순위가 도구 간 일반화되는 정도는 계수 0.348에 불과, 신뢰수준(0.80) 도달엔 약 38개 도구가 필요한 것으로 추정
- 3.15개 결과 중 4개는 모델 간 차이가 아예 없었고, 한 도구로 얻은 '선호'는 다른 도구 결과를 거의 예측 못함
왜 중요한가?
AI 모델 복지 논의가 단일 설문 방식 결과에 의존하는 경우가 많은데, 이 측정 자체가 도구에 따라 크게 흔들려 신뢰하기 어렵다는 것을 실증해 연구방법론에 근본적 의문을 제기한다.
본문 미리보기
arXiv:2608.23641v1 Announce Type: new Abstract: Model welfare research infers what a model prefers from the answers returned to prompts written to elicit preferences. Keeling et al. (2024), Mazeika et al. (2025), Mikaelson et al. (2025), Tagliabue and Dung (2025) and Trhlik et al. (2026) have built four instruments for that purpose, and their findings disagree. The disagreement cannot be attributed to a single cause, because no two of these studies have held the (1) set of outcomes, (2) set of
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
