Mistral AI vient de dévoiler Shieldstral, un modèle d’intelligence artificielle conçu pour la modération de contenus à risque, qu’ils soient textuels ou visuels. Ce modèle est désormais accessible gratuitement pour tous. La startup française présente Shieldstral comme un « classifieur de sécurité multimodal de 3 milliards de paramètres ». Il est capable de modérer divers types de contenus à l’aide d’une méthode de question-réponse binaire, indiquant si un contenu pose problème, comme l’apologie de la violence ou des images inadaptées à un jeune public. Shieldstral fonctionne comme un filtre entre l’utilisateur et le contenu, renvoyant un score de risque qui permet aux entreprises de décider de laisser passer, de bloquer ou de transmettre le contenu à un modérateur. Une des innovations de Shieldstral réside dans la flexibilité de son utilisation. Contrairement à d’autres outils de modération qui reposent sur des règles figées nécessitant un réentraînement lourd pour être modifiées, Shieldstral permet aux utilisateurs de formuler les consignes sous forme de questions en langage naturel au moment de l’utilisation. Par exemple, des questions telles que « Ce contenu incite-t-il à la violence ? » ou « Cette image peut-elle être montrée à un mineur ? » sont directement intégrées. Cette approche permet au modèle de s’adapter à différents contextes sans nécessiter de réentraînement. Ainsi, un contenu acceptable pour un outil de recherche en cybersécurité pourrait être jugé problématique sur une plateforme grand public, selon les politiques définies par l’utilisateur. Mistral AI souligne que la réponse appropriée dépend du produit, du public cible et du contexte. Chaque requête envoyée à Shieldstral se compose de trois éléments : le contexte d’évaluation, la question fermée à laquelle le modèle répond par oui ou par non, et le contenu à examiner. Le modèle renvoie ensuite une note de risque, tandis que l’entreprise définit le seuil d’action à partir duquel elle réagit. Mistral AI affirme que Shieldstral dépasse des outils de modération jusqu’à sept fois plus volumineux, selon les benchmarks publiés par l’entreprise. Enfin, Shieldstral est disponible en open weights sous licence Apache 2.0, compatible avec un usage commercial. Le modèle peut être téléchargé sur Hugging Face et s’inscrit dans la stratégie open source de Mistral AI, qui inclut déjà d’autres modèles comme Devstral et Mistral 3, tous deux également distribués sous la même licence. Source : Mistral AI


