AI 모델 경량화 기업 노타가 중국 문샷AI의 초거대 모델 '키미 K3'(매개변수 2조8000억 개)를 경량화해 구동에 필요한 엔비디아 B300 GPU를 기존 8장에서 최대 4장까지 절반으로 줄였다고 밝혔다. 노타는 자체 개발한 '비균일 전문가 프루닝' 기술로 층별 중요도를 분석해 핵심 전문가 모듈은 보존하고 기여도가 낮은 모듈만 선별 제거하는 방식을 사용했다. 이를 통해 전문가 모듈을 각각 25%, 50% 줄인 경량화 모델 2종을 공개했으며, 자체 평가에서는 기존 균일 제거 방식(REAP)보다 GPQA-Diamond, IFEval 등 주요 벤치마크에서 더 높은 성능 보존율을 기록했다. 앞서 공개한 업스테이지 '솔라 오픈2' 경량화 모델이 2주 만에 6만8000회 다운로드를 기록한 데 이어, 이번 성과로 대규모 MoE 모델에 대한 기술 적용성을 입증했다는 평가다.
- •노타가 문샷AI '키미 K3'(2조8000억 매개변수)를 경량화해 필요 GPU를 8장에서 최대 4장으로 줄였다.
- •자체 개발한 '비균일 전문가 프루닝' 기술로 층별 중요도에 따라 차등적으로 모듈을 제거했다.
- •전문가 모듈 25%, 50% 감축 모델 2종을 공개하고 GPQA-Diamond, IFEval 등에서 기존 방식보다 우수한 성능 보존율을 기록했다.
- •앞서 공개한 업스테이지 '솔라 오픈2' 경량화 모델은 2주 만에 6만8000회 다운로드를 기록한 바 있다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
노타, 문샷AI '키미 K3' 경량화 모델 공개…GPU 수 8장에서 최대 4장으로 줄였다
본문 미리보기
인공지능 모델 경량화 및 최적화 기술 기업 노타(대표 채명수)가 최근 업계에서 주목받는 중국 문샷AI의 초거대 AI 모델 ‘키미 K3(Kimi K3)’를 경량화해 구동에 필요한 GPU를 최대 50%로 줄였다고 5일 밝혔다. 이는 2조8000억 개의 매개변수를 갖춘 프론티어급 AI 모델에서도 자체 기술력을 입증했다는 평가다.키미 K3는 입력값에 따라 필요한 모듈만 선택적으로 활성화하는 전문가 혼합(Mixture-of-Experts·MoE) 구조를 채택해 연산 효율을 높인 프론티어급 오픈웨이트 AI 모델이다. 높은 성능만큼 구동에 엔비
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:00AI 초안
