LLM의 정확하고 결정론적인 계산 능력을 평가하기 위해 CoT, 최소-최다 분해, Program-of-Thought, 자기 일관성 등 다양한 프롬프팅 전략을 비교했다. CoT는 제한적 개선만 제공하고 최소-최다 방식은 오류 누적 문제가 있는 반면, PoT는 외부 인터프리터에 계산을 위임해 완벽한 정확도를 달성했다. LLM은 추론 패턴을 시뮬레이션할 뿐이며, 결정론적 과제에는 외부 도구 결합이나 특화 모델이 더 적합하다는 결론을 도출했다.
- •CoT는 제한적 개선만, 최소-최다 방식은 오류 누적 문제를 보이며, PoT만이 완벽한 정확도를 달성했다.
- •소형 도메인 특화 모델(CodeT5-small)을 훈련해 최소 훈련 비용으로 모든 과제에서 완벽한 정확도를 달성했다.
- •자기 일관성(SC)은 다수결 투표로 강건성을 높이지만 상당한 계산 오버헤드가 발생한다.
- •LLM은 추론 패턴을 시뮬레이션할 뿐이며, 결정론적 과제엔 외부 도구나 특화 모델이 더 신뢰할 수 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs
- 1.CoT·PoT·SC 등 프롬프팅 전략을 정확한 결정론적 계산 태스크에서 체계적으로 비교 평가
- 2.PoT가 외부 인터프리터로 계산 위임해 완벽한 정확도 달성, CoT는 제한적 효과
- 3.CodeT5-small을 미세 훈련해 모든 태스크에서 완벽 정확도 달성, 확장성 미존한 LLM 도구 결합 권장
왜 중요한가?
LLM이 추론 패턴을 모방할 뿐 실제 기호 계산을 신뢰할 수준으로 수행하지 못함을 실증하며, 정확도가 중요한 프로덕션 시스템에서 외부 도구와의 결합이 필수임을 확인시켜 준다.
언급 프로젝트
본문 미리보기
arXiv:2605.03227v1 Announce Type: new Abstract: Large Language Models (LLMs) have demonstrated strong capabilities in natural language understanding and reasoning. However, their ability to perform exact, deterministic computation remains unclear. In this work, we systematically evaluate multiple prompting strategies, including Chain-of-Thought (CoT), Least-to-Most decomposition, Program-of-Thought (PoT), and Self-Consistency (SC), on tasks requiring precise and error-free outputs, including bi
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:12AI 초안

