MIT테크놀로지리뷰는 AI 모델들이 여전히 취약한 퍼즐 유형을 소개하며 독자가 직접 풀어보도록 안내했다. 2024년 말 컬럼비아대 연구팀은 최상위 모델도 뉴욕타임스 커넥션즈 퍼즐의 18%만 풀었지만 2025년 초에는 일부 모델이 거의 완벽하게 풀어내는 등 AI 퍼즐 실력이 빠르게 향상되고 있다고 전했다. 그럼에도 공간 회전 문제 같은 3D 시각 추론, 낯익은 퍼즐의 미묘한 변형, ARC-AGI 같은 추상적 시각 규칙 추론에서는 여전히 사람에게 뒤처진다. 애플 연구진은 하노이의 탑이나 강 건너기 퍼즐에서 원반·인원이 6개 이상으로 늘면 모델 성능이 급격히 떨어진다는 결과를 발표했다.
- •2024년 말 최상위 모델도 NYT 커넥션즈 퍼즐 18%만 해결, 2025년 초엔 거의 완벽 해결로 급성장
- •3D 공간회전·정밀 시각추론 등에서는 AI가 여전히 인간보다 크게 뒤처짐
- •낯익은 퍼즐의 미묘한 변형에 취약, 훈련 데이터 암기에 의존하는 경향 확인
- •애플 연구: 하노이의 탑·강 건너기 퍼즐에서 요소가 6개 이상이면 모델 성능 급격히 저하
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
AI models flub these intelligence tests. Can you fare any better?
- 1.MIT 테크리뷰, AI가 취약한 공간추론·기사단과 건달·SimpleBench·ARC-AGI 등 퍼즐 유형 정리
- 2.2024년 컬럼비아대 연구서 최고모델도 NYT Connections 18%만 해결, 2025년초 거의 완벽 해결로 급성장
- 3.애플 연구팀, 하노이의 탑·강건너기 퍼즐서 원반·인원 6개 이상부터 LLM 성능 급락 확인
- 4.지능그리드 퍼즐(ZebraLogic)·기사단과 건달 변형에서도 LLM은 사소한 변형에 취약, 인간은 쉽게 감지
왜 중요한가?
AI가 벤치마크 점수에서는 빠르게 향상되고 있지만 공간추론·미묘한 문제 변형 감지 등에서 여전히 인간에 못 미친다는 점을 보여줘, 벤치마크 점수만으로 AI 지능을 판단하는 것의 한계를 시사한다.
언급 프로젝트
본문 미리보기
Puzzles and games have been central to AI development since the very beginning. Just as we humans like to test our smarts with crosswords or logic puzzles, developers can test how far models have advanced with a gaming gauntlet. The term “machine learning” was popularized in a 1959 article by the IBM computer scientist Arthur…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
