세레브라스시스템즈가 '디스어그리게이션(분리형 추론)' 기법을 적용해 동일한 시스템 수로도 추론 처리량을 5배 늘렸다고 밝혔다. 이는 프롬프트 처리(프리필)는 연산 집약적이고 토큰 생성(디코드)은 메모리 집약적이라는 서로 다른 특성을 활용해, 두 단계를 별도의 하드웨어 풀로 분리하고 독립적으로 확장·스케줄링하는 방식이다. 세레브라스는 AWS 트레이니움, AMD 헬리오스 인스팅트 GPU 등 파트너 가속기로 프리필을 처리하고 자사 웨이퍼스케일칩(WSE)으로 디코드를 전담하는 이기종 분리 구조를 선도하고 있다고 설명했다. 벤치마크에서 GPT-oss-120B 모델 기준 세레브라스의 초당 출력 토큰 수(1669개)는 삼바노바(708개), 그록(475개) 등 경쟁사를 크게 앞섰으며, 긴 멀티턴 작업이 많은 에이전틱 AI 애플리케이션에 특히 적합하다고 밝혔다.
- •세레브라스, '디스어그리게이션' 기법으로 동일 하드웨어에서 추론 처리량 5배 향상
- •프리필(연산 집약)과 디코드(메모리 집약)를 별도 하드웨어 풀로 분리해 독립 확장
- •AWS 트레이니움·AMD 헬리오스 GPU 등 파트너 가속기와 자사 WSE 결합한 이기종 구조
- •GPT-oss-120B 벤치마크서 초당 1669토큰... 삼바노바(708)·그록(475) 등 경쟁사 크게 앞서
- •장기·멀티턴 작업이 많은 에이전틱 AI에 특히 유리하다고 설명
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Cerebras Reports 5X Inference Throughput Gain From Disaggregation

- 1.세레브라스, 프리필·디코드 단계를 분리하는 '디스어그리게이션' 기법으로 동일 하드웨어에서 추론 처리량 5배 향상 발표(10/1)
- 2.AWS 트레이니엄·AMD 헬리오스 인스팅트 GPU를 프리필 전용으로 활용해 세레브라스 디코드 풀에 연결하는 이기종 전략 공개
- 3.GPT-oss-120B 고난이도 추론 벤치마크에서 세레브라스가 초당 1669토큰으로 샘바노바(708)·그록(475) 등을 크게 앞섬
- 4.온칩 SRAM 대역폭이 웨이퍼당 2만1000TB/s로 HBM4 GPU(약 22~23TB/s) 대비 압도적으로 높다고 소개
왜 중요한가?
프리필과 디코드의 서로 다른 연산 특성을 분리해 이기종 하드웨어를 조합하는 방식은, 긴 멀티턴 에이전트 워크로드처럼 지연시간 누적이 치명적인 서비스에서 추론 비용과 속도를 동시에 개선할 실질적 해법으로 제시된다.
언급 프로젝트
본문 미리보기
Cerebras Systems said on October 1, 2026 that it increased inference throughput by 5x in early results using a technique called disaggregation, with the same number of Cerebras systems and no loss in token generation speeds. The disclosure came in Disaggregated Inference From the Ground Up, a company blog post by Isaac Tai and Zhenwei Gao that opens a planned series on the subject. The post frames the series for readers who have heard the term disaggregation, or the claim that prefill is…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안

