미스트랄이 30억 파라미터의 안전성 분류 모델 '실드스트랄(Shieldstral)'을 공개했다. 고정된 위험 카테고리 대신 운영자가 실행 시점에 자연어 예/아니오 질문을 정의해 재훈련 없이 안전 기준을 조정할 수 있다. 텍스트 안전 벤치마크에서 F1 84.9%를 기록해 7배 큰 GPT-OSS-Safeguard-20B와 동률을 이뤘고, 이미지·텍스트 통합 분류에서는 83.8%로 최고 성능을 달성했다. 약 5410만 개의 안전·유해콘텐츠·조작 시도 데이터를 결합해 학습했으며, 다른 언어모델로 안전한 텍스트를 위험하게 재작성한 합성 데이터가 신규 규칙 적응력을 크게 끌어올린 핵심 요인으로 확인됐다. 미스트랄의 Ministral-3B와 Pixtral 비전 인코더 기반으로, 아파치 2.0 라이선스의 오픈웨이트 모델로 공개됐다.
- •고정 카테고리 대신 자연어 예/아니오 질문으로 운영자가 런타임에 안전 기준을 직접 정의
- •텍스트 벤치마크 F1 84.9%로 7배 큰 GPT-OSS-Safeguard-20B와 동률, Qwen3Guard-8B·LlamaGuard-4-12B 상회
- •이미지·텍스트 통합 분류에서 83.8%로 OmniGuard-7B, LlavaGuard-7B 능가
- •합성 데이터(안전 텍스트를 위험하게 재작성)가 F1을 23.3%p 끌어올려 신규 규칙 적응력의 핵심 동력
- •단일 토큰만 반환해 추론 비용이 낮아, 장문 추론이 필요한 경쟁 모델보다 실용적이라고 평가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Mistral's open model Shieldstral matches much larger safety models at a fraction of the size

본문 미리보기
Mistral's new 3B Shieldstral model checks AI inputs and outputs for safety violations using natural language yes-or-no questions instead of fixed categories. It matches models seven times its size in some benchmarks. Operators can set their own criteria at runtime rather than rely on a third party's category system, and the model can run locally. The article Mistral's open model Shieldstral matches much larger safety models at a fraction of the size appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:52AI 초안

