연구진이 9GB 규모의 오픈웨이트 모델 Qwen2.5-14B(4비트 양자화)를 1984년부터 2025년까지 41개 시즌, 총 52만 9,939개 문제로 구성된 제퍼디! 전체 데이터셋에 대해 평가했다. 이는 모델이 제퍼디! 전체 코퍼스에 대해 테스트된 첫 사례로, 이 모델은 엄격한 강제응답 방식에서 전체 문제의 67.0%를 맞혔고 사실형 카테고리에서는 85%를 넘었다. 특히 훈련 데이터 마감 이후 방영된 문제에서는 로컬 모델이 65%, Claude Opus 4.8이 95%를 기록한 반면, 과거 데이터에 맞춰 튜닝된 IBM 왓슨은 이런 신규 문제를 전혀 맞히지 못했을 것이라는 점에서 대조된다. 연구진은 2011년 왓슨이 서버실에 갇혀 있던 지식 캡슐이었다면, 이제는 이런 문화적 지식 스냅샷이 파일 하나로 휴대 가능하고 사실상 무료로 구현됐다고 평가한다.
- •9GB 오픈웨이트 모델 Qwen2.5-14B, 제퍼디! 전체 52만 9,939개 문제로 첫 전수 평가
- •강제응답 방식에서 전체 정답률 67.0%, 사실형 카테고리는 85% 이상
- •훈련 마감 이후 문제에서 로컬 모델 65%, Claude Opus 4.8은 95% 기록
- •왕슨은 과거 문제에 특화돼 학습 후 신규 문제에는 대응 불가한 구조
- •문화적 지식 스냅샷이 서버실 규모에서 파일 하나로 휴대 가능해졌음을 시사
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
- 1.9GB 경량 오픈웨이트 모델 Qwen2.5-14B(4비트)를 전체 Jeopardy! 문제 52만9939개에 평가
- 2.전체 41개 시즌(1984~2025) 전량 평가는 이번이 처음, 정답률 67.0%, 사실형 문제는 85% 이상
- 3.모델 학습 마감 이후 출제된 문제에서도 65% 정답, IBM 왓슨은 구조상 0%
- 4.동일 최신 문제에서 Claude Opus 4.8은 95% 기록, 소형 로컬 모델과 최상위 모델 격차 확인
왜 중요한가?
2011년 서버실 규모였던 왓슨급 지식 능력이 이제 9GB 파일 하나로 옮겨질 수 있음을 보여주며, 학습데이터 노출 논란을 실측 데이터로 재평가할 근거를 제공한다.
본문 미리보기
arXiv:2608.27459v1 Announce Type: new Abstract: In 2011, IBM's Watson was something like a sealed capsule of its era's queryable knowledge. Its DeepQA system defeated the strongest human Jeopardy! champions, but the knowledge that let it do so lived in a curated billion-document corpus running on a cluster of POWER7 servers, frozen at build time and impossible to move or copy. We show that the same kind of artifact, a snapshot of what a culture can answer, is now portable and essentially free.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
