LLM 수학 추론이 실패로 기우는 정확한 순간을 단일 토큰 수준에서 포착하는 '클리프 토큰(cliff token)' 개념을 제안한 연구다. 국소 토큰별 잠재력에 맞춰 조정되는 적응형 임계값과 단측 이표본 비율 z-검정으로 잠재력이 급락하는 토큰을 식별한다. 7개 모델과 GSM1K, MATH500, AIME 2025 세 벤치마크에서 첫 클리프 토큰을 삭제하고 재샘플링하면 pass@64가 1.0까지 회복되는 반면 유지하면 0.71~1.00에 그쳐, 클리프 토큰이 실제 실패 방아쇠임을 확인했다. 결정적·불확실·샘플링 이탈의 3유형 분류 체계도 제시했으며, 클리프 위치에 단일 토큰 선호 최적화를 적용한 Cliff-DPO는 GSM8K 학습만으로 벤치마크 정확도를 최대 +6.6 끌어올렸다. 추론 실패의 미시적 원인 규명과 표적 개선이 가능함을 보여준다.
- •실패를 촉발하는 단일 토큰 '클리프 토큰'을 적응형 임계값 + z-검정으로 식별
- •7개 모델 × 3개 벤치마크(GSM1K·MATH500·AIME 2025)에서 검증
- •첫 클리프 토큰 삭제 후 재샘플링 시 pass@64가 1.0까지 회복 — 실제 실패 방아쇠 입증
- •결정적·불확실·샘플링 이탈 3유형 분류가 모델 규모에 걸쳐 일반화
- •클리프 위치 단일 토큰 선호 최적화(Cliff-DPO)로 정확도 최대 +6.6 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning
- 1.LLM 수학추론 실패를 유발하는 단일 토큰 'cliff token'을 z-검정 기반으로 식별
- 2.첫 cliff token 삭제 후 재샘플 시 pass@64가 1.0으로 회복(GSM1K·MATH500·AIME 2025)
- 3.cliff를 deterministic·uncertain·sampled-off 3종으로 분류, 모델 규모 무관 일반화
- 4.Cliff-DPO로 cliff 위치 최적화 시 정확도 최대 +6.6 향상
왜 중요한가?
추론 실패 원인을 문장·단계가 아닌 정확한 토큰 단위로 짚어내고, 재샘플·선호최적화로 실패를 교정할 수 있음을 보여 LLM 수학추론의 신뢰성 개선에 직접 기여한다.
본문 미리보기
arXiv:2606.25524v1 Announce Type: new Abstract: Large language models (LLMs) reach high accuracy in mathematical reasoning, but individual traces on the same problem diverge; some arrive at the correct answer while others fail. Prior work analyzes failure at the step, chunk, or sentence level, or at tokens where failure has already occurred. Neither identifies the precise token that triggers the shift toward failure. We introduce the cliff token, a token where the token-wise potential drops sig
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:08AI 초안

