엔비디아의 경량 오픈 모델 '네모트론 3.5 라이트닝'이 아마존 세이지메이커 점프스타트에서 배포 가능해졌다. 총 300억 매개변수 중 30억 개만 활성화되는 하이브리드 전문가 혼합(MoE) 구조로 단일 GPU에서도 구동 가능하며, 대량 에이전트 작업에서 기존 대비 처리량 최대 4배, 작업 완료 속도 최대 30% 향상을 제공한다. 알림 분류, 양식 정보 추출 등 반복적이고 전문화된 에이전트 단계를 프론티어급 대형 모델 없이도 처리하도록 설계됐으며, 최대 100만 토큰의 컨텍스트 길이를 지원한다. 벤치마크에서는 NVFP4 양자화 버전이 BF16과 유사한 정확도를 유지했으며, 세이지메이커 점프스타트를 통해 별도 서빙 인프라 구성 없이 즉시 배포할 수 있다.
- •네모트론 3.5 라이트닝은 300억 매개변수 중 30억 개만 활성화되는 MoE 구조로 단일 GPU에서 구동된다.
- •고볼륨 에이전트 작업에서 처리량 최대 4배, 작업 완료 속도 최대 30% 향상을 제공한다.
- •최대 100만 토큰 컨텍스트를 지원해 장시간 세션에서도 상태를 유지할 수 있다.
- •금융, 사이버보안, 통신, 리테일 등 반복적 고빈도 업무에 특화된 활용을 목표로 한다.
- •NVFP4 양자화 버전은 BF16 대비 벤치마크 정확도가 거의 동등한 것으로 나타났다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
NVIDIA Nemotron 3.5 Lightning now available in Amazon SageMaker JumpStart
- 1.NVIDIA Nemotron 3.5 Lightning, 세이지메이커 점프스타트에서 인프라 구성 없이 배포 가능한 오픈모델로 출시
- 2.300억 파라미터 중 30억만 활성화하는 MoE 구조로 고빈도 에이전트 워크로드서 최대 4배 처리량, 30% 빠른 작업완료
- 3.SWE-bench Verified 52.80점, MMLU Pro 81.94점 등 벤치마크 공개, 컨텍스트 길이 최대 100만 토큰
- 4.네모트론3 울트라서 증류돼 개발, 개인비서·금융·보안운영·통신·리테일 등 특화 작업용으로 설계
왜 중요한가?
모든 에이전트 단계에 대형 프론티어 모델을 쓰는 대신 고빈도·특화 작업에 소형 모델을 라우팅하는 '시스템 오브 모델스' 접근을 지원해, 상시 가동 에이전트의 비용과 지연시간을 낮출 수 있는 실용적 옵션이다.
언급 프로젝트
본문 미리보기
NVIDIA Nemotron 3.5 Lightning, an open model built for high-volume agentic workloads, is now available in Amazon SageMaker JumpStart. This post shows how to deploy the 30B Mixture-of-Experts model (3B active), which delivers up to 4x higher throughput and up to 30% faster task completion for always-on agents.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:55AI 초안

