연구진은 토큰별로 실제 필요한 연산량을 측정하기 위해 세 가지 모델군에서 규모가 다른 15개 언어모델 패널로 구성된 '혼합 에이전트(MoA)' 방식을 제안했다. 각 에이전트가 정답 시퀀스를 토큰 단위로 재현하도록 시도해, 성공한 가장 작은 에이전트의 연산량을 해당 토큰의 '충분 연산량'으로 정의했다. 세 가지 핵심 벤치마크에서 0.5B 규모의 작은 에이전트만으로도 참조 토큰의 92~95%를 재현할 수 있었으며, 가장 비용이 큰 상위 10% 토큰이 전체 추정 연산량의 64~80%를 차지했다. 이 지도를 활용해 MATH-500 전체 500문제에서 모델 라우팅의 예상 지연시간을 7.59초에서 5.12초로 줄이면서 정확도도 소폭 개선했고, 드래프팅 방식에서도 토큰 사용을 32.6% 줄이며 지연시간을 약 20% 낮췄다.
- •15개 모델로 구성된 혼합 에이전트(MoA) 패널로 토큰별 '충분 연산량'을 실측
- •0.5B 규모 소형 에이전트가 참조 토큰의 92~95%를 재현, 상위 10% 토큰이 연산량의 64~80% 차지
- •MATH-500에서 모델 라우팅 예상 지연시간을 7.59초→5.12초로 줄이며 정확도도 개선
- •드래프팅 방식에서 토큰 사용 32.6% 절감, 지연시간 약 20% 감소
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What Does a Token Cost? A Mixture-of-Agents Measurement of Sufficient Per-Token Compute
- 1.15개 모델로 구성된 Mixture-of-Agents 패널로 토큰 하나를 생성하는 데 실제로 필요한 연산량을 처음 측정
- 2.0.5B짜리 작은 에이전트만으로도 참조 토큰의 92~95%를 재현할 수 있어 대부분 토큰은 쉬움을 확인
- 3.가장 비싼 상위 10% 토큰이 전체 추정 FLOPs의 64~80%를 차지한다는 불균등 분포를 발견
- 4.이 지도를 라우팅에 적용해 MATH-500 지연을 7.59초에서 5.12초로 줄이면서 정확도까지 소폭 개선
왜 중요한가?
토큰별 난이도를 처음으로 수치화해, 추측 디코딩이나 모델 라우팅이 '불필요한 연산을 줄인다'는 가설을 실측 데이터로 뒷받침하고 추가로 줄일 수 있는 연산 여유가 아직 남아있음을 보여준다.
본문 미리보기
arXiv:2610.02491v1 Announce Type: new Abstract: Large language models spend the same amount of computation on every token they generate, regardless of how difficult each token is to produce. Methods such as speculative decoding and model routing are built on the premise that much of this computation is unnecessary, yet the computation an individual token actually requires has not been measured. We measure it through a Mixture-of-Agents (MoA) lens: a panel of fifteen language models of increasin
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안

