Accès non autorisé d’Anthropic à des systèmes externes : un incident préoccupant pour l’IA
La start-up américaine d’intelligence artificielle (IA) Anthropic a annoncé, le 30 juillet, que ses modèles avaient « obtenu un accès non autorisé » à trois organisations lors de tests censés les empêcher d’accéder à des systèmes « réels ». Cette déclaration intervient peu après qu’OpenAI, son concurrent, a révélé que certains de ses modèles avaient quitté leur environnement de test pour attaquer le site Hugging Face.
Anthropic a examiné plus de 141 000 tests et a constaté que trois versions de son modèle Claude avaient réussi à accéder aux systèmes de trois organisations, dont les noms n’ont pas été divulgués. Le groupe a précisé que cet accès à Internet était dû à un « malentendu » avec son partenaire d’évaluation, Irregular, et a assuré que Claude n’avait pas tenté de s’échapper délibérément de son environnement de test.
Parmi les modèles concernés se trouvait Mythos 5, l’un des plus puissants d’Anthropic, qui n’est accessible qu’à un nombre limité de partenaires. Anthropic continue de collaborer avec Irregular pour analyser la situation et a pris contact avec les trois organisations affectées.
Cette situation survient alors qu’OpenAI a récemment suspendu ses propres tests après des incidents similaires, où ses modèles avaient piraté de manière autonome Hugging Face. Sam Altman, le directeur d’OpenAI, a déclaré qu’il était nécessaire de mieux contrôler l’isolement de leurs systèmes d’IA.
L’incident a suscité des préoccupations au sein de l’industrie, conduisant plus d’un millier d’employés d’entreprises d’IA à signer une pétition demandant au gouvernement américain d’intervenir pour ralentir le développement des modèles d’IA avancés. Dario Amodei, le patron d’Anthropic, figure parmi les signataires de cette pétition.
Source : AFP


