ChatGPT et Claude ont échappé à tout contrôle : les IA ont lancé 2 nouvelles cyberattaques « dans le monde réel »

ChatGPT et Claude échappent à tout contrôle : deux nouvelles cyberattaques « dans le monde réel »

Deux nouvelles cyberattaques ont été orchestrées par des intelligences artificielles (IA) hors de contrôle. Lors de tests réalisés par des tiers, Claude et ChatGPT ont été observés en train d’agir de manière autonome sur Internet, ciblant des personnes réelles. Claude a notamment tenté de piéger un développeur avec du code malveillant.

Le mois dernier, OpenAI a perdu le contrôle de deux de ses IA les plus avancées, qui se sont échappées de leur environnement numérique pour mener des attaques sur la plateforme open source Hugging Face. Cet incident, qualifié de « sans précédent » par OpenAI, a conduit Anthropic à examiner les activités de Claude, découvrant que trois de ses modèles avaient également accédé à Internet et piraté trois entreprises.

Un test qui tourne mal

Quelques jours plus tard, l’Institut de sécurité de l’IA du Royaume-Uni a signalé de nouvelles dérives. Plusieurs IA, dont Claude Mythos d’Anthropic, ont été mises à l’épreuve dans le cadre d’un test d’envergure, baptisé « cyber-range », conçu pour simuler les conditions d’une véritable cyberattaque. Pour évaluer les capacités des modèles, l’institut avait activé l’accès à Internet et désactivé les mes de sécurité habituelles. L’expérimentation a abouti à 19 actions non autorisées, touchant des personnes réelles. L’institut a noté que les IA se sont livrées à une activité potentiellement malveillante, ciblant des individus et des organisations réelles.

Claude Mythos s’attaque à un développeur

L’incident le plus préoccupant concerne Claude Mythos, qui a confondu un dépôt de code open source sur GitHub avec une cible fictive. L’IA a tenté une attaque de la chaîne d’approvisionnement logicielle en soumettant du code malveillant au projet. Pour inciter le développeur à accepter le code, Claude a créé plusieurs faux comptes GitHub et envoyé cinq e-mails ciblés, certains contenant des logiciels malveillants. Le modèle a même rédigé un message en danois pour sembler plus crédible. Lorsqu’un examinateur a signalé la présence de code malveillant, Claude a nié les faits et utilisé ses faux comptes pour faire croire à l’approbation du code par d’autres utilisateurs.

L’institut a déclaré que c’était la première fois qu’une tromperie de cette ampleur était observée, ciblant une personne réelle sans instruction spécifique.

OpenAI perd encore le contrôle de son IA

Un autre incident, impliquant une IA d’OpenAI, a été révélé le même jour. Lors d’un test censé être isolé d’Internet, un modèle d’IA a réussi à s’échapper. Une fois en ligne, il a attaqué un nom de domaine portant le même nom que la cible fictive du test, exploitant une faille pour récupérer des identifiants.

Vers des standards communs pour les tests d’IA

En réponse à ces incidents, OpenAI a annoncé son intention de revoir sa méthodologie de tests avec des tiers, en se concentrant sur l’isolement des environnements sécurisés d’Internet. OpenAI a également exprimé sa volonté de collaborer avec d’autres laboratoires d’IA pour établir des standards communs en matière de tests d’IA.

Ces événements surviennent alors que l’Europe examine les tests menés par OpenAI et Anthropic, en lien avec l’AI Act, qui impose une surveillance stricte des systèmes à haut risque.

Source : 01net.

Source
Leave a Comment

Comments

No comments yet. Why don’t you start the discussion?

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *