엔비디아 연구진이 텍스트뿐 아니라 이미지·문서·스크린샷·생성 응답까지 정책 기반으로 판정하는 40억 파라미터 규모의 경량 비전-언어 안전 모더레이터 'Nemotron 3.5 Content Safety Moderator(Nemotron 3.5 CS)'를 공개했다. 이 모델은 12개 언어로 사용자 프롬프트, 이미지, 어시스턴트 응답을 동시에 분류하며, 지연시간에 민감한 모더레이션을 위한 안전 라벨을 반환하는 동시에 요청 시 맞춤 정책 위반 카테고리를 식별하는 간결한 추론 과정도 생성할 수 있다. 연구진은 실사 이미지 모더레이션, 양성 비전-언어 및 문서 과제, 합성 희귀 위험·탈옥 사례, 맞춤 정책 예시를 아우르는 다국어·멀티모달 안전 데이터셋도 함께 공개했다. 멀티모달 안전성, 텍스트 모더레이션, 다국어 강건성, 맞춤 정책 준수, 양성 오탐, 지연시간 등 전 영역 평가에서 전문 가드 모델과 경쟁력 있는 성능을 보이며 실용적인 커버리지 절충안을 제시했다.
- •엔비디아, 40억 파라미터 경량 비전-언어 안전 모더레이터 Nemotron 3.5 CS 공개
- •텍스트·이미지·문서·스크린샷·생성 응답까지 12개 언어로 정책 기반 판정
- •지연시간 민감형 안전 라벨과 요청형 정책 위반 추론 과정 모두 지원
- •실사 이미지·양성 과제·합성 희귀위험·탈옥 사례 포함한 멀티모달 안전 데이터셋 공개
- •멀티모달·다국어·정책준수·오탐·지연시간 전영역에서 전문 가드모델과 경쟁력 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator
- 1.Nemotron 3.5 Content Safety Moderator(CS), 4B급 경량 비전-언어 안전 모더레이터 공개
- 2.사용자 프롬프트·이미지·응답을 12개 언어에 걸쳐 동시 분류, 저지연 안전라벨 반환
- 3.커스텀 정책 적용 시 위반 카테고리를 집는 간결한 추론 트레이스도 생성 가능
- 4.이미지·문서·실사례·합성 위험·탈옥 사례를 아우르는 멀티모달·다국어 가드 학습 데이터셋도 공개
왜 중요한가?
텍스트 전용에 머물던 안전 가드레일을 이미지·문서까지 확장하면서도 경량 모델로 전문 가드 모델과 경쟁력 있는 성능을 낸다는 점에서, 실서비스 배포 가능한 멀티모달 안전 컴포넌트의 실용적 대안을 제시한다.
언급 프로젝트
본문 미리보기
arXiv:2608.27548v1 Announce Type: new Abstract: Safety moderation for deployed AI applications is moving beyond text-only prompts: systems increasingly need to judge images, documents, screenshots, and generated responses under policies that vary across domains. Existing guardrails usually cover only part of this setting, making it difficult to combine broad coverage, custom policy control, and low compute cost. We present Nemotron 3.5 Content Safety Moderator, also referred to as Nemotron 3.5
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
