이 논문은 언어모델에 탐색·검증·수정 같은 추론 구조를 추가하는 것이 항상 이득인지, 아니면 그 자체가 예산을 잡아먹어 오히려 손해가 되는 임계점이 있는지를 실증적으로 검증한다. 금융 추론 과제(FinQA, TAT-QA)에서 GPT-5.4 mini를 사용해 250토큰부터 4만2천 토큰까지 14단계 예산으로 단일 LLM 호출(모놀리스)과 계획·검증·수정 기능을 더한 검증형 탐색 아키텍처를 1,000건씩 총 2만8천 셀에 걸쳐 비교했다. 두 시스템 모두 가장 낮은 예산 두 단계에서는 완전한 프롬프트조차 채우지 못해 0%였고, 1,000토큰에서는 모놀리스가 18%를 기록한 반면 검증형 탐색은 계획 수립에 예산을 다 써버려 거의 0%에 그쳤다. 그러나 1,500토큰부터는 검증형 탐색이 역전해 계속 우위를 유지하며 최고 예산에서 약 44%까지 도달, 모놀리스(약 40%)를 앞질렀다. 교차점은 1,000~1,500토큰 사이로 통계적으로 유의(p≤0.001)하게 확인됐다.
- •FinQA·TAT-QA 금융 추론 과제에서 250~42,000토큰 14단계 예산으로 모롬리스 vs 검증형 탐색 비교
- •1,000토큰에서는 모롬리스 18% vs 검증형 탐색 거의 0%—구조화 오버헤드가 답변 여지를 잠식
- •1,500토큰부터 검증형 탐색이 역전, 최고 예산에서 약 44% 대 모롬리스 약 40%로 우위 유지
- •구조화 이득이 손해로 바뀜어지는 교차점을 1,000~1,500토큰 사이로 통계적 유의성(p≤0.001)과 함께 특정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Thinking Costs Tokens: When More Structure is Worth the Price
- 1.FinQA·TAT-QA 과제에서 GPT-5.4 mini로 단일호출·검증형 탐색을 14개 토큰예산 구간에서 비교
- 2.1,000토큰에서는 단일호출이 18% 정확도로 앞졌고 검증형 탐색은 계획 오버헤드로 거의 0%
- 3.1,500토큰부터 검증형 탐색이 역전해 우위를 유지, 최고 구간에서 약 44% vs 단일호출 약 40%
- 4.계획·검증 구조 도입에는 1,000~1,500 토큰 사이 손익분기점이 존재함을 통계적으로 확인(p≤0.001)
왜 중요한가?
추론 구조(계획·검증·재시도)가 항상 유리한 것은 아니며 토큰 예산이 부족하면 오히려 성능을 해친다는 구체적 손익분기 기준을 제시해, 에이전트 설계 시 예산 배분 전략에 실질적 지침을 준다.
언급 프로젝트
본문 미리보기
arXiv:2608.27506v1 Announce Type: new Abstract: Adding inference structure to a language model lets it search, verify, and revise, but these actions consume the very budget they are supposed to use well. In this paper, we investigate whether there exists a token-budget threshold, below which the overhead of planning and verification hurts performance and above which it helps. We evaluate two systems on FinQA and TAT-QA financial reasoning tasks, using GPT-5.4 mini across 14 budget tiers ranging
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
