긴 사고사슬(CoT) 추론은 복잡한 문제 해결력을 높이지만 중복 누적, 컨텍스트 초과, 오류 고착 같은 문제도 함께 불러온다. 연구진은 제한된 컨텍스트 창 아래에서 진짜 병목은 궤적 압축이나 테스트 시점 제어가 아니라, 버려진 이력을 대체하며 풀이를 이어갈 수 있는 재사용 가능한 '중간 인터페이스'의 부재라고 주장한다. 또한 결과 보상 기반 강화학습의 숨은 실패 양상도 짚었는데, 컨텍스트 창이 거의 소진될 때까지 문제를 풀지 못한 모델에게 최종답 보상은 신중한 추론 지속 대신 성급한 추측을 부추긴다는 것이다. 이에 연구진은 '인터페이스 기록 후 리셋'을 통해 재사용 가능한 중간 인터페이스를 명시적으로 구축하고 리셋 이후 문제 해결 지속 성공률을 직접 최적화하는 'ThinkReset'을 제안했으며, 여러 장기추론 벤치마크에서 고정된 컨텍스트 창 조건 하 성공률을 일관되게 향상시켰다.
- •긴 CoT 추론의 진짜 병목은 압축이나 제어가 아닌 재사용 가능한 중간 인터페이스 부재라고 주장
- •결과보상 기반 RL이 컨텍스트 소진 직전 성급한 추측을 유도하는 실패양상 규명
- •인터페이스 기록 후 리셋 방식으로 재사용 가능한 중간 인터페이스를 명시적으로 구축하는 ThinkReset 제안
- •리셋 이후 문제해결 지속 성공률을 직접 최적화하는 목적함수 채택
- •여러 장기추론 벤치마크에서 고정 컨텍스트 창 조건 하 성공률 일관되게 향상
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning
본문 미리보기
arXiv:2607.28642v1 Announce Type: new Abstract: Long chain-of-thought reasoning improves performance on complex problems, but it also introduces redundancy accumulation, context overflow, and error anchoring. We argue that under bounded context windows, the core bottleneck is not trajectory compression or test-time control, but the absence of a reusable intermediate interface that can replace discarded history and support continued solving. We further identify a key failure mode of outcome-rewa
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:10AI 초안

