이 논문은 최전선 LLM을 목표 인식 과제에 대해 처음으로 체계적으로 제로샷 평가한 연구로, 고전적 PDDL 벤치마크에서 평가를 수행했다. 목표 인식은 새로운 행동 시퀀스 생성 대신 세계 지식과의 일관성을 평가하는 귀납적 작업으로 LLM의 강점과 잘 맞는다. 일부 모델은 증거에 따라 스케일링되어 전체 관찰 시 랜드마크 기반 정확도에 근접하지만, 다른 모델은 얼마나 많은 증거가 쌓여도 세계 지식 사전에 고착된다. 이러한 차이는 도메인 친숙도가 아니라 증거 통합 방식의 근본적인 차이에서 비롯됨을 모델 추론 흔적 분석으로 밝혔다.
- •LLM의 목표 인식은 새로운 행동 시퀀스 생성보다 세계 지식과의 일관성 평가에 더 적합한 궀납적 과제다.
- •일부 모델은 증거에 따라 스케일링되어 랜드마크 기반 정확도에 근접하지만, 다른 모델은 증거와 무관하게 세계 지식 사전에 고착된다.
- •이 차이는 도메인 친술도가 아닌 증거 통합 방식의 근본적 차이를 반영한다.
- •목표 인식은 LLM의 기초 계획 지식에 대한 원칙적 벤치마크로 활용될 수 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Zero-Shot Goal Recognition with Large Language Models
- 1.프론티어 LLM을 PDDL 목표 인식 태스크에 제로샷으로 평가한 최초의 체계적 연구
- 2.일부 모델은 증거 누적에 따라 성능이 향상되나 다른 모델은 사전 지식 편향에 고착됨
- 3.이 차이는 도메인 친숙도가 아닌 증거 통합 방식의 근본적 차이에서 비롯됨
- 4.목표 인식이 LLM의 계획 추론 능력을 평가하는 원칙적 벤치마크로 제안됨
왜 중요한가?
LLM이 진정한 상징적 추론을 하는지 아니면 세계 지식에 의존하는지를 구분하는 새로운 벤치마크를 제시하며, AI 계획 역량 평가 방법론 발전에 기여한다.
본문 미리보기
arXiv:2605.15333v1 Announce Type: new Abstract: Large language models have recently reached near-parity with classical planners on well-known planning domains, yet this competence relies on world-knowledge exploitation rather than genuine symbolic reasoning. Goal recognition is a complementary abductive task structurally better suited to LLM strengths: it consists of evaluating consistency with world knowledge rather than generating novel action sequences. This paper provides the first systemat
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

