Moonshot AI가 2026년 4월 20일 Kimi K2.6(Modified MIT)을, 13일 전 Z.ai가 GLM-5.1(MIT, 754B, Huawei Ascend 910B 10만 칩 학습, NVIDIA 0대)을 동시 공개하며 SWE-Bench Pro에서 각각 58.6% vs 58.4%로 양강 구도를 형성했다. 저자가 15개 실제 프로덕션 코딩 태스크를 모델당 45회(총 90회) 동일 스캐폴드·툴 예산으로 돌려본 결과, 공개 벤치마크의 0.2점 차이는 전체 비교 중 가장 작은 격차였고 실제 코딩 품질(11점 격차)과 가격(43% 차이)에서는 결과가 뒤집힌다. 중국 오픈웨이트 모델이 글로벌 코딩 LLM 상위권을 차지하는 구조 변화를 보여준다.
- •Kimi K2.6(Modified MIT) vs GLM-5.1(MIT) — 두 중국 오픈웨이트 모델이 SWE-Bench Pro 양강 구도(58.6% vs 58.4%).
- •GLM-5.1은 Huawei Ascend 910B 10만 칩으로 학습 — NVIDIA GPU 0대의 754B 파라미터 모델.
- •공개 벤치마크 0.2점 격차가 실제 코딩 품질에서는 11점 격차로 벌어짐 — 벤치마크만 보고 선택하면 오판.
- •두 모델 간 API 비용 격차가 43% — 벤치마크 '승자'가 실제 코딩 태스크에서는 밀리는 구조.
- •중국 오픈웨이트 코딩 모델이 글로벌 프런티어와 동등 또는 우위 구간에 진입했다는 시장 시그널.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
I Tested Kimi K2.6 vs GLM-5.1 on 15 Real Coding Tasks
- 1.Kimi K2.6·GLM-5.1 중국 오픈웨이트 모델이 SWE-Bench Pro 양강.
- 2.GLM-5.1은 Huawei Ascend 910B 10만 칩 학습 — NVIDIA 없이 754B 달성.
- 3.벤치마크 0.2점 차이가 실사용에서는 11점 격차로 역전.
- 4.API 가격 43% 격차 — 총비용 기준 '승자'가 뒤바뀜.
- 5.중국 오픈웨이트 코딩 LLM이 프런티어 수준 도달 — 공급 구도 재편.
왜 중요한가?
오픈웨이트 코딩 LLM 시장에서 중국 두 랩이 동시에 프런티어급 모델을 MIT 계열 라이선스로 출시했다는 사실 자체가 이벤트다. 특히 GLM-5.1이 Huawei Ascend 칩만으로 754B를 학습한 것은 미국 제재 구도에서 '중국 자립 스택' 가시성이 커지는 신호다. 한국 AI 팀이 코딩 에이전트·사내 코드 리뷰 파이프라인을 구축할 때 Claude·GPT-5뿐 아니라 이들 오픈웨이트를 실제 태스크 기반으로 비교해야 하며, 단순 SWE-Bench 수치가 아닌 실 작업 품질·비용 매트릭스를 보는 관행이 중요해졌다.
본문 미리보기
Two Chinese open-weight models now sit at the top of the global SWE-Bench Pro leaderboard: Kimi K2.6 at 58.6% and GLM-5.1 at 58.4%. On… Continue reading on Towards AI »
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:33AI 초안

