IBM 그래니트 팀이 첫 추론 전용 언어모델 패밀리 '그래니트 4.2'(3B·8B·30B)의 구축 과정을 공개했다. 약 15조 토큰으로 처음부터 사전학습해 5단계 전략으로 컨텍스트 윈도우를 51만2000토큰까지 확장했고, 사고/비사고 모드 전환과 네이티브 툴콜링을 지원하며 아파치 2.0으로 배포됐다. 8B·30B 모델은 SFT 이후 RLVR→스킬 부스터→SWE 에이전트→터미널→검색 순의 다단계 강화학습(GRPO)을 거쳐 실제 샌드박스 환경에서 코드 실행·터미널 조작·웹검색을 학습했으며, 30B는 SWE-Bench Verified 57.00, AIME25 89.17, GPQA 66.41 등에서 8B·3B보다 높은 성능을 기록했다. 이 모델들은 엔비디아 GB200 NVL72 클러스터에서 학습됐으며 FP8·NVFP4·MXFP4·GGUF 양자화 버전도 함께 공개됐다.
- •그래니트 4.2, 15조 토큰 사전학습·컨텍스트 51만2000토큰까지 확장, 아파치 2.0
- •8B·30B는 SWE·터미널·검색 에이전트 강화학습(GRPO) 추가 수행, 3B는 미적용
- •30B 모델이 SWE-Bench Verified 57.00, AIME25 89.17 등 최고 성능 기록
- •엔비디아 GB200 NVL72 클러스터에서 학습, FP8·FP4·GGUF 양자화 버전도 배포
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Granite 4.2 LLMs: How They're Built
- 1.IBM, 추론 특화 'Granite 4.2' 3B·8B·30B 공개, 약 15조 토큰 사전학습·컨텍스트 512K 확장
- 2.8B·30B는 SWE→터미널→검색 순 에이전틱 강화학습(GRPO)으로 실제 도구사용 훈련
- 3.SWE-Bench Verified 57.00, AIME25 89.17 등 30B 기준 추론·코딩 성능 최상위
- 4.FP8·NVFP4·MXFP4·GGUF 양자화 버전 함께 공개, 전 모델 Apache 2.0 라이선스
왜 중요한가?
사전학습부터 SFT, 다단계 강화학습까지 전 과정을 상세히 공개한 오픈 모델로, 에이전틱 RL 파이프라인(NeMo-RL/NeMo-Gym) 구성을 그대로 참고할 수 있어 자체 에이전트 모델을 만들려는 팀에 실질적 청사진을 제공한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
