LLM의 창의적 문제 해결 능력을 평가하는 CreativityBench를 소개한다. 4천 개 엔티티와 15만 개 이상의 어포던스 주석으로 구성된 지식 베이스를 구축하고, 이를 기반으로 14,000개의 과제를 생성해 10개 최신 LLM을 평가했다. 모델들은 적절한 사물 선택에는 성공하지만, 올바른 부품과 그 기능적 사용을 파악하는 데 실패하는 것으로 나타났다. 모델 크기 증가나 Chain-of-Thought 같은 추론 전략의 효과는 빠르게 포화 상태에 이르러, 창의적 도구 사용은 현재 AI 모델의 중요한 미해결 과제임이 확인됐다.
- •CreativityBench는 4K 엔티티, 150K+ 어포던스 주석 기반 지식 베이스로 구축된 LLM 창의적 추론 평가 벤치마크다.
- •현재 LLM은 사물 선택은 가능하지만, 부품 기능과 물리적 메커니즘 파악 능력이 부족하다.
- •모델 스케일링 효과는 빠르게 포화되며, Chain-of-Thought 전략의 창의적 추론 개선 효과도 미미했다.
- •창의적 도구 사용 능력은 미래 에이전트의 계획 및 추론 모듈 설계에 중요한 시사점을 제공한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
- 1.LLM의 어포던스 기반 도구 재활용 능력 평가를 위한 벤치마크 CreativityBench 및 어포던스 KB 구축
- 2.4체 엔티티·14만 개 어포던스 주석, 1.4만 개 그라운드 태스크로 능력 다방면 평가
- 3.모델 확장도 빠르게 포화, CoT 등 일반 추론 스일로는 상스조식적 창의성 개선 한계 지시
왜 중요한가?
창의적 도구 활용은 현재 최고 수준 LLM도 해결하지 못하는 미개척 영역임을 체계적으로 실증하며, 에이전트의 계획·추론 모듈 발전을 위한 새로운 연구 방향을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2605.02910v2 Announce Type: new Abstract: Recent advances in large language models have led to strong performance on reasoning and environment-interaction tasks, yet their ability for creative problem-solving remains underexplored. We study this capability through the lens of creative tool use, where a model repurposes available objects by reasoning about their affordances and attributes rather than relying on canonical usage. As a first step, we introduce CreativityBench, a benchmark for
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

