알리바바 큐원팀이 차세대 Qwen4 아키텍처를 미리 보여주는 오픈웨이트 모델 'Qwen3.8-Flash-Next'를 공개했다. 총 1250억 파라미터 중 토큰당 60억개만 활성화하는 MoE 구조이며, GPU가 아닌 시스템 RAM에서 구동되는 510억 파라미터 규모의 'N그램 임베딩' 층을 새로 도입했다. Qwen3.7-Plus(3970억 파라미터) 대비 약 9분의 1의 학습 비용으로 더 나은 성능을 냈다고 주장하며, SWE-bench Pro(62.5점)와 DeepSWE(58.7점)에서 딥시크-V4-Flash와 앤트로픽 클로드 오퍼스 4.6을 앞섰다. 가격은 입력 100만 토큰당 0.16달러, 출력 0.47달러로 자사 플래그십 Qwen3.8-Max 대비 약 12분의 1 수준이며, 26만2144토큰 컨텍스트를 기본 지원하고 YaRN으로 100만 토큰까지 확장 가능하다.
- •총 1250억 파라미터 중 토큰당 60억개만 활성화하는 MoE 모델, Qwen4 아키텍처 프리뷰로 공개
- •GPU 대신 시스템 RAM에서 구동되는 신개념 'N그램 임베딩' 층(510억 파라미터) 도입
- •Qwen3.7-Plus 대비 약 9분의 1 학습비용으로 SWE-bench Pro·DeepSWE 등에서 더 높은 점수 기록
- •가격은 입력 100만토큰당 0.16달러·출력 0.47달러, 플래그십 Qwen3.8-Max 대비 약 12분의 1
- •26만2144 토큰 기본 컨텍스트, YaRN으로 최대 100만 토큰까지 확장 지원
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"

- 1.알리바바 Qwen3.8-Flash-Next 공개, Qwen4 아키텍처 미리보기로 125B 총파라미터 중 토큰당 6B만 활성화하는 MoE 구조
- 2.51B규모 N-gram 임베딩 레이어를 GPU 대신 시스템 RAM에 배치, 26만 토큰 네이티브·YaRN으로 100만 토큰까지 확장
- 3.Qwen3.7-Plus 대비 약 9분의 1 학습비용으로 여러 벤치마크에서 DeepSeek-V4-Flash·Claude Opus 4.6를 능가
- 4.QwenCloud 가격은 입력 100만토큰당 $0.16·출력 $0.47로 자체 플래그집 Qwen3.8-Max 대비 약 12배 저렴
왜 중요한가?
더 적은 활성 파라미터와 학습 비용으로 훨씬 큰 모델을 뛰어넘는 성능을 보여주며 오픈AI·앤트로픽 등 프론티어 모델 가격 인하 압박을 가중시켜, AI 업계의 수익성 경쟁 구도를 재편할 수 있는 저비용 모델 경쟁의 신호탄이다.
본문 미리보기
Alibaba's Qwen team is previewing the Qwen4 architecture with Qwen3.8-Flash-Next, a mixture-of-experts model that activates just 6 out of 125 billion parameters per token. At one-ninth the training cost, it beats much larger competitors like DeepSeek-V4-Flash and Claude Opus 4.6 on coding and office benchmarks, adding more pricing pressure on OpenAI and Anthropic. The article Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency" appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:32AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
