Shieldstral is Mistral's open multimodal safety classifier that adapts to moderation policies
arXiv 3 weeks ago 45 ● 4 sources
Mistral released Shieldstral, a 3-billion-parameter multimodal safety classifier that formulates content moderation as binary yes-no questions to unify diverse safety datasets. The model was trained on approximately 54.1 million samples and matches or outperforms models nearly 7 times its size on text safety benchmarks while achieving state-of-the-art multimodal safety classification. The policy-adaptive design lets moderation systems consolidate heterogeneous datasets with different taxonomies under one training framework.