커서(Cursor)가 엔비디아 블랙웰 기반 GB300/GB200 NVL72 서버 환경에 특화된 오픈소스 MoE 학습 커널 'MoK(Mixture-of-Kittens)'를 아파치 2.0 라이선스로 공개했다. 전문가 혼합(MoE) 모델 학습의 최대 병목인 GPU 간 통신과 연산을 하나의 결정론적 메가커널로 통합해, 기존 공개 구현 대비 MXFP8 순전파에서 최대 2.37배 빠른 처리량을 기록했다. 커서는 자체 코딩 모델 '컴포저' 학습에 MoK를 실제 적용해, 512개 GPU 환경에서 GPU당 초당 처리 토큰 수가 760.9개에서 1070.2개로 늘어 전체 학습 처리량이 약 41% 향상됐다고 밝혔다. 다만 블랙웰 SM100·SM103 GPU와 특정 소프트웨어 버전이 필요해 활용처는 대형 연구소나 슈퍼컴퓨팅 센터 등으로 제한된다.
- •MoE 계층의 GPU 간 통신과 연산을 하나의 결정론적 메가커널로 통합해 병목이던 통신 비용을 최소화
- •MXFP8 순전파 기준 기존 공개 구현(DeepEP, NCCL+PyTorch 등) 대비 최대 2.37배 빠른 처리량
- •512개 GPU 실제 학습 환경에서 전체 처리량 약 41%(1.41배) 향상을 실증
- •GB300/GB200 NVL72 등 블랙웰 전용 하드웨어 요구로 대규모 인프라 보유 기관에 활용 제한
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
커서, 블랙웰 서버 전용 MoE 커널 'MoK' 공개…학습 처리량 41% 향상
본문 미리보기
대규모 AI 모델 학습에서 가장 큰 병목으로 꼽히는 전문가 혼합(MoE) 계층의 통신 문제를 해결하기 위한 새로운 오픈소스 기술이 등장했다. 커서(Cursor)는 4일(현지시간) 엔비디아 블랙웰(Blackwell) 기반 GB300 NVL72 서버 환경에서 대규모 전문가 혼합(MoE) AI 모델을 더 빠르게 학습할 수 있는 오픈소스 기술 'MoK(Mixture-of-Kittens)'를 아파치 2.0 라이선스로 오픈소스 공개했다.이 기술은 대규모 MoE 모델의 학습 속도를 높이기 위해 통신과 연산을 하나로 통합했으며, 기존 공개 기술보
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:57AI 초안
