PlanningBench는 LLM의 계획 능력 평가 및 훈련을 위한 확장 가능하고 검증 가능한 데이터 생성 프레임워크다. 30개 이상의 과제 유형과 제약 패밀리를 포함한 구조화된 분류 체계를 기반으로 한다. 제약 중심 합성 파이프라인이 적응형 난이도와 인스턴스 수준 검증 체크리스트를 갖춘 계획 문제를 생성한다. 검증된 데이터로 강화학습 시 미출현 계획 벤치마크와 광범위한 지시 수행 과제에서 성능이 향상된다.
- •30개 이상의 과제 유형과 제약 패밀리를 포함한 분류 체계로 계획 데이터 구성을 고정 벤치마크 수집에서 제어 가능한 생성으로 전환한다.
- •검증된 PlanningBench 데이터로 강화학습 시 미출현 계획 벤치마크에서 성능이 향상된다.
- •현재 LLM들은 복합 제약 하에서 완전한 해결책을 생성하는 데 여전히 어려움을 겁는다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models
- 1.LLM 평가와 훈련을 위한 확장 가능하고 검증 가능한 계획 데이터 생성 프레임워크 PlanningBench 소개
- 2.30개 이상의 작업 유형과 난이도 요소를 포함한 구조화된 분류 체계로 계획 문제 자동 생성
- 3.현재 프론티어 LLM들은 복합 제약 조건 하에서 완전한 해결책 생성에 여전히 어려움을 겪음
- 4.검증된 데이터를 이용한 강화학습이 미지의 계획 벤치마크에서 성능 향상 확인
왜 중요한가?
LLM의 계획 능력 측정과 개선을 위한 제어 가능한 데이터 생성 프레임워크로, AI 평가 및 훈련 연구에 핵심 기여를 한다.
언급 프로젝트
본문 미리보기
arXiv:2605.20873v1 Announce Type: new Abstract: Planning is a fundamental capability for large language models (LLMs) because such complex tasks require models to coordinate goals, constraints, resources, and long-term consequences into executable and verifiable solutions. Existing planning benchmarks, however, usually treat planning data as fixed collections of instances rather than controllable generation targets. This limits scenario coverage, ties difficulty to surface-level proxies rather
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

