LLM의 추론 흔적에서 탐색 트리를 추출·분석하여 LLM의 계획 방식이 근시안적(myopic)임을 밝힌 연구입니다. 4목 게임을 통해 LLM의 탐색은 인간보다 얕으며, 성능은 탐색 깊이가 아닌 너비에 의해 예측됩니다. 가장 주목할 만한 발견은 LLM이 추론 흔적에서 깊은 노드를 확장하더라도 실제 수 선택은 깊은 노드를 완전히 무시하는 근시안 모델로 가장 잘 설명된다는 점입니다. 이는 인간 전문성이 깊은 탐색에 의해 결정되는 것과 대비되는 LLM과 인간 계획 간의 핵심 차이를 드러냅니다.
- •4목 게임에서 LLM 추론 흔적의 탐색 트리를 추출하고 계산 모델로 정량화하는 새로운 방법론을 제시하며, LLM 탐색이 인간보다 얕음을 확인했다.
- •LLM의 성능은 탐색 깊이가 아닌 너비에 의해 예측되며, 추론 흔적에 깊은 노드가 있더라도 실제 수 선택은 이를 무시하는 근시안 모델로 가장 잘 설명된다.
- •CoT 단락을 선택적으로 제거하는 인과 개입 실험에서 수 선택이 주로 얕은 노드에 의해 결정된다는 인과적 증거를 확보했다.
- •인간 전문성이 깊은 탐색에 의해 결정되는 것과 달리 LLM은 깊은 예측에 기반하여 행동하지 않는다는 핵심 차이는 LLM 계획 능력 정렬에 구체적 방향을 제시한다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning
- 1.LLM 추론 흐적에서 탐색 트리를 추출해 계획 구조를 분석하는 새로운 방법 제안
- 2.LLM의 탐색은 인간보다 업으며, 성능은 탐색 깊이가 아닌 넓이에 의해 결정됨
- 3.LLM은 깊은 노드를 추론에 포함하지만 실제 행동 선택은 근시안적 모델로 설명됨
- 4.인간은 깊은 탐색이 성능을 결정하는 반면, LLM은 깊은 예측에 기반해 행동하지 않음
왜 중요한가?
LLM과 인간의 계획 방식 차이를 구체적으로 밍혀, LLM 추론 정렬 및 고위험 의사결정 시스템 설계에 중요한 시사점을 제공한다.
본문 미리보기
arXiv:2605.06840v1 Announce Type: new Abstract: Large language models (LLMs), especially reasoning models, generate extended chain-of-thought (CoT) reasoning that often contains explicit deliberation over future outcomes. Yet whether this deliberation constitutes genuine planning, how it is structured, and what aspects of it drive performance remain poorly understood. In this work, we introduce a new method to characterize LLM planning by extracting and quantifying search trees from reasoning t
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

