Anthropic bloque des détournements de ses modèles d’IA pour des usages malveillants
Anthropic a annoncé avoir empêché des tentatives d’acteurs malveillants cherchant à utiliser ses modèles d’intelligence artificielle pour des cyberattaques, de la surveillance et des recherches biologiques pouvant contribuer au développement d’armes. Dans son troisième rapport sur les détournements de l’IA, publié jeudi, l’entreprise a souligné que les cyberattaques devenaient de plus en plus accessibles, permettant à des individus isolés de créer des menaces auparavant impossibles.
L’entreprise a précisé avoir renforcé les garde-fous de ses modèles les plus récents afin de limiter les recherches biologiques à double usage. Anthropic a déclaré que les exemples présentés dans le rapport illustrent des menaces inédites et marquantes. Le rapport comprend des extraits de code malveillant et des requêtes adressées à l’IA, appelant les gouvernements et les entreprises concurrentes à surveiller des abus similaires.
La société, qui prépare une introduction en Bourse pour cet automne, a publié ce rapport peu après la démission d’un de ses chercheurs, inquiet de la responsabilité de l’entreprise dans le développement de l’IA.
Entre décembre 2025 et août 2026, des détournements ont été identifiés, impliquant des vendeurs de logiciels espions et des groupes soutenus par des États. Un cas notable concernait une tentative d’utiliser le chatbot Claude pour rédiger une demande de subvention pour des recherches sur le virus du chikungunya, visant à modifier sa transmissibilité. Bien que ce type de recherche puisse contribuer à des avancées médicales, il présente également des risques pour la sécurité.
Anthropic a mis en place des garde-fous plus stricts pour ses modèles récents, tels que Claude Fable 5, en réponse à la complexité croissante des recherches scientifiques qu’ils peuvent assister. Des experts plaident pour une régulation gouvernementale de l’IA, soulignant les risques de décisions non encadrées par des normes démocratiques.
Enfin, le rapport a mis en lumière des campagnes de désinformation sur les réseaux sociaux, avec des groupes créant de faux comptes pour diffuser des messages politiques. Anthropic a affirmé avoir bloqué toutes les activités malveillantes identifiées et espère que ses conclusions aideront d’autres développeurs à repérer des menaces similaires.
Source : Euronews

