메타인지(자신의 추론을 모니터링·조절하는 능력)는 AI 벤치마크에서 저평가돼 왔다. MEDLEY-BENCH는 독립 추론, 사적 자기 수정, 사회적 영향 수정을 실제 모델 간 불일치 하에서 분리하는 메타인지 벤치마크. 12개 패밀리의 35개 모델을 130개 모호 케이스 × 5 도메인으로 평가. MMS(메타인지 스코어)와 MAS(능력 스코어) 제공. 평가 능력은 모델 크기와 함께 증가하지만 제어 능력은 그렇지 않다는 '평가/제어 분리' 확인. 35개 모델 모두에서 평가 능력이 상대적으로 가장 약하다는 knowing/doing gap 드러냄.
- •MEDLEY-BENCH — 메타인지 평가 벤치마크 (12 패밀리 35 모델)
- •독립 추론·사적 자기수정·사회적 영향 수정 분리 측정
- •평가 능력은 스케일과 함께 증가, 제어는 아님
- •모든 35 모델에서 평가 능력이 상대적으로 가장 약함
- •작은 모델이 큰 모델을 능가하는 케이스 — 메타인지는 스케일 함수 아님
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition
- 1.AI 메타인지의 구조적 knowing/doing gap 정량화
- 2.평가는 스케일, 제어는 스케일과 무관
- 3.소형 모델이 대형 능가 — 메타인지 설계의 독립성
왜 중요한가?
AI 에이전트가 자율 의사결정에 투입되는 시점에서 '자기 인식·수정 능력'은 핵심 안전 속성. MEDLEY-BENCH는 이 능력을 정량화해 훈련 목표 재정립.
언급 프로젝트
본문 미리보기
arXiv:2604.16009v1 Announce Type: new Abstract: Metacognition, the ability to monitor and regulate one's own reasoning, remains under-evaluated in AI benchmarking. We introduce MEDLEY-BENCH, a benchmark of behavioural metacognition that separates independent reasoning, private self-revision, and socially influenced revision under genuine inter-model disagreement. The benchmark evaluates 35 models from 12 families on 130 ambiguous instances across five domains and reports two complementary score
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:32AI 초안

