연구진은 Claude Sonnet 5 모델에서 reasoning-effort를 명시적으로 '높음'으로 설정한 경우와 생략한 경우를 AIME 2026 수학 문제 30개, 문항당 5회 호출로 비교했다. 명시적 고효과 설정은 호출당 평균 $0.01031 더 비쌌지만 정확도 차이는 통계적으로 유의하지 않았다(+0.0133, 신뢰구간 -0.0267~+0.0467). 정답 1개당 비용은 고효과 설정이 $0.08665, 생략 설정이 $0.07662로 생략 쪽이 더 저렴했다. 이는 reasoning-effort 파라미터가 모델별로 다르게 해석되는 '계약' 조건임을 보여주며, 비용 대비 정확도 이득이 불분명한 상황에서 무조건 높은 추론 강도를 요청하는 것이 최선이 아닐 수 있음을 시사한다.
- •Sonnet 5에서 reasoning-effort '높음' 명시 시 호출당 $0.01031 더 비쌈
- •정확도 차이(+0.0133)는 통계적으로 유의하지 않음(-0.0267~+0.0467)
- •정답당 비용은 생략 설정이 $0.07662로 고효과 설정($0.08665)보다 저렴
- •reasoning-effort는 모델마다 다르게 해석되는 API 계약 조건
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Price of Thinking: Reasoning Effort as a Model-Specific API Contract
- 1.Sonnet 5의 'high' reasoning-effort 명시 설정과 미설정을 AIME 2026 30문제로 등록된 대조 실험으로 비교
- 2.명시적 high 설정이 호출당 평균 $0.01031 더 비싸며, 정확도 차이는 +0.0133p로 통계적으로 감지되지 않음
- 3.정답당 비용은 high 설정 $0.08665, 미설정 $0.07662로 미설정이 더 저렴함을 사전등록 추정치로 확인
- 4.모델·공급사별로 reasoning-effort 생략 시 의미가 달라짐을 문서화, 사전등록된 통계 계획으로 분석 진행
왜 중요한가?
API 가격이 모델명뿐 아니라 reasoning-effort 조건 같은 계약 세부항목에 좌우됨을 사전등록 실험으로 정량화해, effort를 높게 설정해도 정확도 개선이 검증되지 않은 채 비용만 늘 수 있다는 실무적 경고를 제공한다.
본문 미리보기
arXiv:2608.16956v1 Announce Type: new Abstract: API buyers purchase a dated contract, not a model name alone: the contract includes the requested and served model, reasoning-effort term or its omission, output rail, service product, prompt, and price schedule. We study the reasoning-effort term through a registered paired contrast of Sonnet 5 with explicit high effort against the same model with effort omitted, using 30 AIME 2026 items and five calls per item. Every paid attempt was assigned on
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
