구글 딥마인드가 새 모델을 처음부터 학습시키는 대신 기존 Gemma 4를 확산모델(diffusion model)로 변환한 DiffusionGemma의 기술보고서를 공개했다. 토큰을 하나씩 생성하는 대신 256개 블록을 병렬로 정제하는 방식으로, 원래 학습 토큰 예산의 10% 미만만 사용해 H100에서 초당 약 1,500토큰의 속도를 낸다. 노이즈 텍스트 복원 학습에 이어 강화학습과 샘플러 증류를 결합한 'SD·RL' 단계를 거치면서 추론 벤치마크 점수는 평균 10점 상승하고 압축 스텝당 토큰 수는 거의 4배로 늘었다. 양방향 추론 덕분에 답을 먼저 확정하지 않고 나중에 오류를 수정할 수 있어 스도쿠 정답률이 미세조정 후 85%에 달했지만, 절대 품질은 자기회귀 방식인 원본 Gemma 4에 못 미치고 32건 이상 동시 요청 시 속도 우위도 사라진다.
- •구글 딥마인드가 Gemma 4를 처음부터 재학습하지 않고 확산모델로 전환한 DiffusionGemma 기술보고서 공개
- •256토큰 블록을 병렬 정제하는 방식으로 H100에서 초당 약 1,500토큰 처리
- •원래 학습 토큰 예산의 10% 미만만 사용해 전환, 추론 벤치마크 평균 10점 상승
- •양방향 추론으로 오류를 후속 단계에서 수정 가능, 스도쿠 정답률 미세조정 후 약 85%
- •품질은 자기회귀 Gemma 4에 못 미치고 32건 이상 동시 요청 시 속도 우위 소멸
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Google's DiffusionGemma proves you don't need to train from scratch to build a text diffusion model

본문 미리보기
Instead of training a new model from scratch, Google DeepMind retrofitted Gemma 4 into a diffusion model using less than 10 percent of the original training budget. DiffusionGemma generates 256 tokens in parallel instead of one at a time, hitting about 1,500 tokens per second. Quality still trails the original autoregressive model in benchmarks, especially on reasoning tasks. The article Google's DiffusionGemma proves you don't need to train from scratch to build a text diffusion model appeared
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:52AI 초안

