Mistral AI가 8월 4일 3B 파라미터 오픈웨이트 안전 분류기 Shieldstral을 Apache 2.0 라이선스로 공개했다. 학습 시 고정된 유해 카테고리를 내장하는 기존 가드레일 모델과 달리, 추론 시점에 자연어로 작성된 모더레이션 정책을 입력받아 yes/no 질문에 대한 토큰 로짓으로 보정된 안전 점수를 산출한다. 약 5,410만 샘플로 학습해 텍스트 안전 벤치마크 평균 F1 84.9%로 7배 큰 GPT-OSS-Safeguard-20B와 동급이며, 멀티모달 안전에서는 83.8%로 최고 성능을 기록했다(벤더 자체 측정). 12개 언어를 지원하고 16GB GPU 한 장에서 구동돼, 재학습 없이 제품별 정책에 맞춰 쓸 수 있는 경량 모더레이션 수단이 열렸다는 의미가 있다.
- •정책을 가중치가 아닌 입력(<Query> 필드)으로 받아 재학습 없이 제품별 기준 적용 가능
- •텍스트 안전 평균 F1 84.9%로 4B~20B 공개 모델 중 1위, 멀티모달 83.8%로 OmniGuard-7B(77.6%) 앞서
- •약 5,410만 샘플 학습, LLM 생성 대조 쌍으로 카테고리 암기가 아닌 정책 변별력을 학습
- •Ministral-3-3B 기반, 12개 언어 지원, 16GB GPU 한 장에서 구동, Apache 2.0
- •아랍어·인도네시아어 등 일부 언어에서 열세는 한계로 명시됨
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mistral’s Shieldstral Packs Policy-Adaptive Safety Screening Into 3B Parameters

본문 미리보기
Mistral AI released Shieldstral on August 4, 2026, a 3B-parameter open-weights safety classifier that judges text and images against moderation policies written in plain language at inference time, rather than a fixed set of harm categories baked in during training. The model is available on Hugging Face under the Apache 2.0 license, covers 12 languages, and runs on a single 16GB GPU. Mistral says in its announcement that Shieldstral matches open guard models up to seven times its size on text…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:28AI 초안

