AI 딥테크 기업 비드래프트가 1800억개(180B) 매개변수 모델 '다윈-180B-RSI'를 경량화한 '포켓-다윈-180B-GGUF'를 미국 허깅페이스와 중국 모델스코프에 동시 공개했다. 전문가혼합(MoE) 구조에서 토큰당 약 30억개 파라미터만 활성화하고 4비트 양자화와 SSD 스트리밍 방식을 결합해, 기존 360GB 모델을 111GB로 줄여 그래픽메모리 8GB·램 32GB급 노트북에서도 구동 가능하게 했다. 서버 GPU 없이 CPU 한 개만으로 초당 18.4~21.0토큰을 생성했으며, MMLU-Pro 2000문항 테스트에서 압축 전후 정답률이 모두 87.65%로 동일해 성능 손실이 거의 없음을 확인했다. 비드래프트는 외부 클라우드 전송이 어려운 기업·공공기관을 주요 타깃으로 보고 있다.
- •비드래프트, 180B 모델을 111GB로 경량화한 '포켓-다윈-180B-GGUF' 공개
- •토큰당 약 30억개 파라미터만 활성화하는 MoE 구조에 4비트 양자화·SSD 스트리밍 결합
- •CPU 한 개만으로 초당 18.4~21.0토큰 생성, 게이밍 노트북에서도 구동 가능
- •MMLU-Pro 테스트에서 압축 전후 정답률 87.65%로 동일해 성능 손실 거의 없음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
“180B 모델, 개인용 노트북으로 구동”...비드래프트, 고성능 모델 경량화 전략 이어간다
- 1.비드래프트, 1800억(180B) 파라미터 '다윈-180B-RSI' 경량화 모델 '포켓-다윈-180B-GGUF' 공개
- 2.360GB 모델을 111GB로 축소, 그래픽메모리 8GB·램 32GB 노트북에서 구동 가능
- 3.MoE 구조 유지한 채 4비트 양자화, SSD 스트리밍으로 전체를 메모리에 안 올리고 실행
- 4.MMLU-Pro 2000문항 기준 압축 전후 정답률 모두 87.65%로 성능 유지
왜 중요한가?
초대형 모델을 서버급 GPU 없이 개인 PC에서 구동 가능하게 하면서 성능 손실이 거의 없어, 클라우드 전송이 어려운 기업·공공기관용 온프레미스 AI 도입 장벽을 크게 낮춘다.
본문 미리보기
비드래프트가 ‘큐원3.8-플래시-넥스트’를 토대로 개발한 1800억 매개변수(180B) 모델의 경량화 버전을 공개했다. 일부 파라미터를 선별적으로 활성화하는 방식으로 성능과 비용 효율을 모두 잡았다는 설명이다.AI 딥테크 전문 비드래프트(대표 김민식)가 180B급 고성능 경량화 모델을 미국 허깅페이스와 중국 모델스코프에 동시 공개했다고 6일 밝혔다.원본 모델인 ‘다윈-180B-RSI’는 BF16 정밀도 기준 모델 파일만 360기가바이트(GB)에 달하는 초대형 모델이다. 통상적으로 엔비디아 B200 GPU 4~8장 또는 H100(80
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안