엔비디아가 초고속 추론과 AI 에이전트 구동에 특화한 오픈가중치 소형 모델 '네모트론 3.5 라이트닝'을 공개했다. 전체 300억 파라미터 중 요청당 30억 파라미터만 활성화하는 혼합전문가(MoE) 구조로 초당 약 670토큰의 처리 속도를 구현했으며, 지능 평가에서는 오픈AI의 'gpt-oss-120b'와 대등한 성능을, 에이전트 작업 벤치마크에서는 상위 모델 '네모트론 3 슈퍼'를 능가했다. 맘바-트랜스포머 하이브리드 구조에 최대 100만 토큰 컨텍스트를 지원하며, NVFP4 양자화 버전은 단일 H100 GPU나 DGX 스파크에서도 구동 가능하다. 엔비디아는 소형 모델로 에이전트 상용화 문턱을 낮춰 결과적으로 GPU 수요를 늘리려는 전략으로 풀이된다.
- •300억 파라미터 중 30억만 활성화하는 MoE 구조로 초당 약 670토큰 처리
- •지능 평가는 gpt-oss-120b와 대등, 에이전트 벤치마크는 상위 모델 '네모트론 3 슈퍼' 능가
- •최대 100만 토큰 컨텍스트 지원, NVFP4 양자화로 단일 H100·DGX 스파크 구동 가능
- •상업적 이용 자유로운 '오픈MDW-1.1' 라이선스로 오픈가중치 생태계 확장 겨낥
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
엔비디아, 초당 670토큰 처리하는 소형 AI 에이전트 모델 '네모트론 3.5 라이트닝' 전격 공개

본문 미리보기
상시 가동 AI 에이전트 시장 겨냥… 초당 670토큰 처리 속도 달성글로벌 반도체 거인 엔비디아(NVIDIA)가 초고속 추론 및 AI 에이전트 구동에 특화된 소형 오픈가중치 모델 '네모트론 3.5 라이트닝(Nemotron 3.5 Lightning)'을 11일(현지시간) 전격 공개했다. 가중치는 물론 학습 데이터와 레시피까지 전체 공개된 이번 모델은 항상 켜져 있는(Always-on) AI 에이전트의 실행 계층(Execution Layer)을 겨냥해 개발되었다.네모트론 3.5 라이트닝은 전체 30B(300억) 파라미터 중 개별 요청당
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:55AI 초안
