Allen Institute for AI(Ai2)가 10월 1일 대규모 MoE 모델을 1조개 이상 파라미터까지 학습시킬 수 있도록 재설계한 오픈소스 학습 프레임워크 올모-코어3를 공개했다. 기존 FSDP 기반 구현을 DDP 기반으로 전환해 전문가 가중치를 GPU에 상주시킴으로써, 8개 NVIDIA B300 GPU에서 470억 파라미터 MoE를 초당 5만2000토큰으로 처리해 기존 대비 약 2.7배의 처리량을 달성했다. 전문가 풀을 8개에서 128개로 늘려도 처리량 저하가 5% 미만으로 유지됐으며, MXFP8 저정밀도 포맷 적용으로 처리량이 BF16 대비 21% 향상되고 최대 활성 메모리는 103GiB에서 95GiB로 줄었다. Ai2는 1.2조 파라미터 모델을 512개 GPU에서 벤치마크했고 DeepEP v2로는 2.38조 파라미터까지 테스트했으며, '토큰 게리맨더링' 등 라우팅 실패 패턴도 기술보고서에 문서화해 차세대 올모 모델 개발에 활용할 계획이다.
- •Ai2, 1조+ 파라미터 MoE 학습을 겨냥한 오픈소스 프레임워크 올모-코어3 공개
- •FSDP→DDP 전환으로 47B 파라미터 MoE 처리량이 기존 대비 약 2.7배(초당 5.2만 토큰) 증가
- •전문가 풀 8→128개 확장 시에도 처리량 저하 5% 미만 유지
- •MXFP8 저정밀도 적용으로 처리량 21% 향상, 최대 메모리 103GiB→95GiB 감소
- •1.2조 파라미터(512GPU) 벤치마크 및 DeepEP v2로 2.38조 파라미터까지 테스트
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Ai2 Releases Olmo-Core 3, Open Training Stack for Trillion-Parameter MoEs

- 1.Ai2, 1조개 파라미터급 MoE 학습이 가능한 오픈소스 프레임워크 Olmo-core 3 공개(10/1)
- 2.전문가(expert) 수를 8개에서 128개로 늘려도 처리량 감소 5% 미만 유지하며 총 파라미터를 46억→470억으로 확장 성공
- 3.B300 GPU 8기 기준 새 DDP 학습 스택이 GPU당 초당 5만2000토큰 처리, 기존 FSDP 대비 2.7배 처리량
- 4.1.2조 파라미터 모델 GPU 512기 벤치마크서 GPU당 858 TFLOP/s 달성, DeepEP v2로 2.38조까지 테스트
왜 중요한가?
MoE 모델이 커질수록 통신·조정 비용이 효율을 갉아먹는 문제를 해결한 오픈소스 학습 스택을 공개함으로써, 트릴리언 파라미터급 모델 학습을 자체 인프라로 시도하려는 연구기관·기업의 진입장벽을 낮췄다.
본문 미리보기
The Allen Institute for AI released Olmo-core 3 on October 1, 2026, an upgrade to its large language model development framework built around a redesigned open mixture-of-experts training system that Ai2 said it has benchmarked at more than one trillion total parameters. Ai2 said Olmo-core 3 is designed to scale MoE training into the trillion-parameter range while preserving computational efficiency, and described it as one of the core systems behind the next generation of Olmo. The release is…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:53AI 초안

