LLM의 여행 계획 능력을 제약 추출, 도구 사용, 계획 생성, 오류 식별, 오류 수정 5가지 원자적 하위 역량으로 분해해 평가했다. 오라클 중간 컨텍스트를 활용한 분리 평가 프로토콜로 각 구성 요소를 엄밀히 측정했으며, LLM은 명시적 제약 추출에는 능숙하지만 암묵적 요구 사항 추론과 자기 수정에서 어려움을 겪는다. 계획 생성에서의 구조적 편향과 과도한 민감성 및 잘못된 지속성으로 나타나는 비효과적인 자기 수정이 주요 약점으로 확인됐다.
- •여행 계획을 제약 추출, 도구 사용, 계획 생성, 오류 식별, 오류 수정 5가지 하위 역량으로 분해해 개별 평가했다.
- •LLM은 명시적 제약 추출엔는 능숙하지만 암묵적·개방형 요구 사항 추론에는 어려움을 격는다.
- •계획 생성에서 구조적 편향이 나타나며, 자기 수정 시 과도한 민감성과 잘못된 지속성이 관찰됐다.
- •분리 평가 프로토콜은 연쳄 오류의 노이즈 없이 각 원자적 성능 한계를 정밀 측정할 수 있게 한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Revisiting the Travel Planning Capabilities of Large Language Models
- 1.LLM의 여행 계획 능력을 5개 원자 하위 능력으로 분해해 돈립 평가하는 프레임워크 제안
- 2.명시적 제약 추출은 우수하지만 암묵적 설계 추론과 자기 수정에서 심각한 결함 확인
- 3.계획 생성 시 구조적 편향성, 오류 방기 경향 등 실패 원인 정밀 진단 가능
왜 중요한가?
LLM의 여행 계획 능력을 종합 점수가 아닌 세부 하위 능력별로 분리 평가해 개선 방향을 구체화하며, 장기 추론 AI 연구에 실용적 진단 도구를 제공한다.
본문 미리보기
arXiv:2605.03308v1 Announce Type: new Abstract: Travel planning serves as a critical task for long-horizon reasoning, exposing significant deficits in LLMs. However, existing benchmarks and evaluations primarily assess final plans in an end-to-end manner, which lacks interpretability and makes it difficult to analyze the root causes of failures. To bridge this gap, we decompose travel planning into five constituent atomic sub-capabilities, including \emph{Constraint Extraction}, \emph{Tool Use}
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

