KWBench는 LLM이 '주어진 문제'를 푸는 게 아니라 '무엇이 문제인지'를 스스로 인식하는 능력을 평가하는 최초의 벤치마크. M&A·계약·임상 약제·조직 정치·사기 분석·인센티브 설계 영역에서 실무자로부터 수집한 223개 태스크 포함. 각 태스크는 게임이론 패턴(대리인 갈등·시그널링·메커니즘 디자인 실패·전략적 생략·연합·전략적 상호의존)을 인코딩. 16개 모델 평가에서 최고 27.9%만 통과, 상위 2모델이 동의하는 케이스는 31.7%에 불과. '모델은 개념을 설명하라면 정확히 하지만 자발적으로 인식·적용은 못 함'이라는 근본 격차 드러냄.
- •LLM이 '문제를 인식'하는 능력을 평가하는 최초 벤치마크
- •223 태스크 × 6 전문 영역, 게임이론 패턴 인코딩
- •16 모델 평가: 최고 27.9% 통과율
- •'모델이 개념을 설명할 수는 있지만 자발적 인식·적용은 못 함'
- •상위 8개 모델 라우팅으로 50.7% 커버 — 단일 모델 한계 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
KWBench: Measuring Unprompted Problem Recognition in Knowledge Work
- 1.LLM의 '문제 인식' 능력 평가 벤치마크 KWBench
- 2.최고 모델도 27.9% 통과 — 근본적 knowing-doing gap
- 3.지식업무 AI 평가 패러다임 전환 주장
왜 중요한가?
LLM 평가가 '태스크 실행'에 몰렸던 상황에서 '문제 인식' 능력을 정면으로 측정. 실세계 지식업무 자동화의 실질 병목을 드러낸 연구.
언급 프로젝트
본문 미리보기
arXiv:2604.15760v1 Announce Type: new Abstract: We introduce the first version of KWBench (Knowledge Work Bench), a benchmark for unprompted problem recognition in large language models: can an LLM identify a professional scenario before attempting to solve it. Existing frontier benchmarks have saturated, and most knowledge-work evaluations to date reduce to extraction or task completion against a specification. KWBench targets the step before that: recognizing the governing structure of the si
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:32AI 초안

