중국 AI 기업 Z.ai가 3200억 파라미터 규모의 오픈소스 모델 'GLM-5.3-Flash'를 공개했다. 액티브 파라미터는 180억 개이며 100만 토큰의 컨텍스트 윈도우와 MIT 라이선스를 제공한다. Artificial Analysis의 인텔리전스 지수에서 57점을 기록해 상위 모델인 GLM-5.3(60점)에 근접하면서도 작업당 비용은 0.09달러로 GLM-5.3의 7.5배 저렴하다. 특히 이 모델은 엔비디아 GPU 없이 전량 중국산 AI 칩에서 운영됐으며, Z.ai가 자체 개발한 서빙 소프트웨어로 엔비디아 GPU 수준의 처리 효율을 달성해 하루 100조 토큰을 처리했다고 알려졌다. 이는 엔비디아의 CUDA 생태계 의존도를 낮추려는 시도로, 업계에서 'CUDA 해자'에 대한 또 다른 시험대로 주목받고 있다.
- •GLM-5.3-Flash, 총 3200억·활성 180억 파라미터, 100만 토큰 컨텍스트, MIT 라이선스
- •인텔리전스 지수 57점으로 GLM-5.3(60점)에 근접, 비용은 7.5배 저렴(작업당 0.09달러)
- •전량 중국산 AI 칩에서 운영, 자체 서빙 소프트웨어로 엔비디아 GPU급 효율 달성
- •OpenCode·OpenRouter서 익명 테스트('ox-alpha') 당시 주간 최다 사용 모델 기록
- •하루 100조 토큰 처리 능력, 엔비디아 CUDA 생태계 의존 탈피 시도로 주목
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia

- 1.Z.ai가 3200억 파라미터 GLM-5.3-Flash 공개, 컨텍스트 100만 토큰 지원
- 2.인텔리전스 지수 57점으로 GLM-5.3(60점)에 근접, 비용은 7.5배 저렴
- 3.엔비디아 없이 중국산 AI 칩에서 자체 서빙 소프트웨어로 처리량 3배 향상
- 4.GDPval-AA v2 에이전트 벤치마크서 Grok 4.6과 동급, Claude Opus 5 다음
왜 중요한가?
엔비디아 GPU 없이도 프런티어급에 근접한 성능과 효율을 낸 사례로, SemiAnalysis가 지적하듯 엔비디아의 CUDA 생태계 우위에 대한 또 하나의 실증적 도전이다.
본문 미리보기
Z.ai releases GLM-5.3-Flash, an open-source model with 320 billion parameters that lands just three points behind the larger GLM-5.3 on Artificial Analysis's Intelligence Index, at a seventh of the cost. What's notable is that all of the inference traffic ran on Chinese AI chips instead of Nvidia hardware. The article GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
