연구진은 LLM이 196회의 연쇄적 도구 호출에 걸쳐 정확한 중간 상태를 유지할 수 있는지 검증하기 위해 MD5 해시를 처음부터 직접 계산하게 했다. 활성 파라미터 약 5.5B에 불과한 gpt-oss-120b는 온도 0, 짧은 고정 프롬프트만으로 64라운드 196회 호출 전체에서 4개의 32비트 워드를 유지하며 대다수 실행에서 정확한 다이제스트를 반환했다. 모든 기본 연산 도구를 제2의 LLM(드라이버-워커 구조)으로 대체한 가장 어려운 설정에서도, 매 턴 자신의 추론을 컨텍스트에 유지하고 사고 기능이 켜진 워커에 다수결 투표를 적용하는 두 요소만으로 모듈러 연산 실수를 제거하고 성공을 이끌어냈다. 이는 장기 과제 실패가 상태 유지·산술 오류·서빙 문제 중 어디서 비롯되는지 구분 가능하게 해, 기존 에이전트 벤치마크가 놓친 원인 분석의 틀을 제시한다.
- •196회 연쇄 도구 호출(64라운드)로 LLM의 MD5 해시 직접 계산 능력을 정밀 측정
- •활성 파라미터 약 5.5B인 gpt-oss-120b가 온도 0에서 대다수 실행에서 정확한 다이제스트 반환
- •연산 도구를 제2의 LLM으로 전부 대체해도 컨텍스트 내 추론 유지와 워커 다수결 투표만으로 성공
- •실패 원인을 상태 유지·산술·서빙 오류로 분리해 기존 벤치마크의 한계를 보완
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
- 1.MD5를 직접 구현해 196회 연쇄 도구 호출 동안 4개 상태값을 문맥에 유지시켜 장기 상태추적력을 측정
- 2.활성 파라미터 약 55억 개인 gpt-oss-120b가 196회 호출 전 구간 상태를 유지해 정확한 다이제스트 도출
- 3.모든 연산 도구를 두 번째 LLM으로 대체해 산술 오라클 없이 해시를 계산하는 설정까지 테스트
- 4.모델 추론을 매 턴 유지하는 것과, 사고 워커 투표로 모듈러 연산 실수를 제거하는 것이 성공을 좌우
왜 중요한가?
긴 에이전트 작업에서 실패 원인을 지시 해석 오류와 순수 상태추적 오류로 명확히 분리해 측정한 사례로, 장기 실행 에이전트의 신뢰성 병목이 정확히 어디에 있는지 짚어준다.
언급 프로젝트
본문 미리보기
arXiv:2609.00012v1 Announce Type: new Abstract: Long-horizon tasks remain uncommon in large language model (LLM) evaluation, and for a reason: when each step depends on the last, per-step accuracy that looks excellent in isolation decays catastrophically, as errors cascade and the end-to-end failure probability grows sharply with length. Existing agentic benchmarks report end-to-end success but confound this state-tracking difficulty with instruction interpretation, give no control group that i
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
