ZAYA1-8B는 Zyphra의 MoE++ 아키텍처 기반으로 총 80억 개 매개변수 중 7억 개만 활성화하는 추론 특화 혼합 전문가(MoE) 모델로, AMD 풀스택 컴퓨팅 플랫폼에서 처음부터 훈련되었습니다. 수학·코딩 벤치마크에서 DeepSeek-R1-0528과 동등하거나 능가하며, 마르코프 RSA 테스트 타임 컴퓨팅 방법으로 AIME'25 91.9%, HMMT'25 89.6%를 달성해 훨씬 큰 추론 모델과의 격차를 좁혔습니다.
- •총 80억 매개변수 중 7억만 활성화하는 MoE++ 아키텍처로 효율적 추론 특화 모델 구현
- •AMD 풀스택 플랫폼에서 처음부터 훈련, 수학·코딩 벤치마크에서 DeepSeek-R1-0528 동등 또는 능가
- •추론 워밍업→RL-VE 짐→수학·코드 RL→행동 RL의 4단계 RL 캐스케이드로 사후 훈련
- •마르코프 RSA로 AIME'25 91.9%, HMMT'25 89.6% 달성, 4K 토큰 테일만 전달
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
ZAYA1-8B Technical Report
- 1.ZAYA1-8B는 700M 활성 파라미터·8B 전체 파라미터의 추론 특화 MoE 모델로 AMD 풀스택에서 훈련
- 2.사전학습부터 추론 데이터 포함, 4단계 RL 쾐스케이드로 수학·코딩·채팅 종합 능력 향상
- 3.Markovian RSA 테스트 타임 컴퓨팅으로 AIME'25 91.9%, HMMT'25 89.6% 달성
왜 중요한가?
1B 미만 활성 파라미터로 DeepSeek-R1-0528에 필적하는 추론 성능을 AMD 인프라에서 실현하여 비용 효율적 추론 모델의 새 기준점을 제시한다.
본문 미리보기
arXiv:2605.05365v1 Announce Type: new Abstract: We present ZAYA1-8B, a reasoning-focused mixture-of-experts (MoE) model with 700M active and 8B total parameters, built on Zyphra's MoE++ architecture. ZAYA1-8B's core pretraining, midtraining, and supervised fine-tuning (SFT) were performed on a full-stack AMD compute, networking, and software platform. With under 1B active parameters, ZAYA1-8B matches or exceeds DeepSeek-R1-0528 on several challenging mathematics and coding benchmarks, and remai
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

