Ai2가 자체 기술 블로그를 통해 올모-코어3의 세부 설계를 공개하며, 라우팅 데이터를 전문가 입력 버퍼에 직접 배치하는 '로우와이즈 전문가 병렬화'와 GPU에 라우팅 메타데이터를 유지하는 'GPU 상주 라우팅', 다수의 소규모 전문가 연산을 묶는 '그룹 GEMM' 등 세 가지 최적화 기법을 소개했다. 이를 통해 8개 B300 GPU에서 470억 파라미터 MoE의 처리량이 기존 FSDP 방식 대비 2.7배(초당 1만9400→5만2000토큰) 증가했으며, MXFP8 저정밀도 포맷 적용 시 BF16 대비 처리량이 21% 늘고 메모리는 103GiB에서 95GiB로 줄었다. Ai2는 '토큰 게리맨더링'(라우팅 균형 지표는 개선되지만 실제 작업 부하는 더 불균형해지는 현상)과 통신·연산 중첩이 오히려 속도를 늦추는 사례 등 실패 경험도 투명하게 공유했다. 차세대 올모 모델이 MoE 구조로 가장 큰 데이터셋과 긴 컨텍스트로 학습될 예정이라고 밝혀, 완전히 공개된 이 학습 스택이 외부 연구자들의 대규모 MoE 실험에도 활용될 수 있음을 시사한다.
- •로우와이즈 전문가 병렬화, GPU 상주 라우팅, 그룹 GEMM 등 세부 최적화 기법 공개
- •8개 B300 GPU에서 47B 파라미터 MoE 처리량 2.7배 증가(초당 1.94만→5.2만 토큰)
- •MXFP8 적용으로 처리량 21% 향상, 메모리 사용량 103GiB→95GiB 감소
- •'토큰 게리맨더링' 등 라우팅 실패 패턴과 통신-연산 중첩의 역효과를 투명하게 공개
- •차세대 올모 모델은 MoE 구조로 최대 데이터셋·최장 컨텍스트 학습 예정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
- 1.Ai2, 조 단위 파라미터급 MoE 학습을 지원하는 오픈소스 프레임워크 Olmo-core 3 공개
- 2.전문가 풀 8→128개로 확장하며 토큰당 활성 파라미터 약 3.2B 유지, 처리량 저하 5% 미만
- 3.FSDP 대신 DDP 기반 구조로 전환, B300 GPU 8기서 처리량 기존 대비 2.7배 향상
- 4.MXFP8 저정밀 포맷 적용 시 BF16 대비 처리량 21% 향상, 피크 메모리 103→95GiB 감소
왜 중요한가?
조 단위 파라미터 MoE 학습 인프라를 오픈소스로 공개해, 대규모 컴퓨트 접근이 제한된 학계·소규모 연구소도 차세대 Olmo급 MoE 모델 개발에 쓸 수 있는 기반을 제공한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

