OpenAI Accusé de Téléchargement Illégal de Livres pour Entraîner ChatGPT
L’éthique des entreprises d’intelligence artificielle est de nouveau mise en question. OpenAI est confronté à des accusations concernant les méthodes employées pour entraîner son robot conversationnel, ChatGPT.
Cette semaine, plusieurs auteurs américains, dont George R. R. Martin, connu pour la série Game of Thrones, ont déposé une requête devant un tribunal fédéral de New York. Ils affirment que l’intelligence artificielle développée par OpenAI, dirigée par Sam Altman, a utilisé des milliers d’œuvres téléchargées illégalement à partir d’un site pirate reconnu.
Ce n’est pas la première fois que des écrivains reprochent à OpenAI de mépriser les droits d’auteur. En 2023, des accusations avaient déjà été portées contre ChatGPT pour avoir utilisé des œuvres sans autorisation, notamment à partir de copies piratées. Aujourd’hui, les auteurs soutiennent qu’OpenAI a téléchargé directement de nombreux livres via torrent depuis un site notoire, Library Genesis, également connu sous le nom de LibGen.
Selon les allégations, OpenAI aurait même renommé des compilations internes, initialement appelées “Libgen1” et “Libgen2”, en “Books1” et “Books2” afin de dissimuler leur provenance illégale. Pour éviter des problèmes juridiques, l’entreprise aurait ensuite supprimé ces fichiers.
Le dossier s’appuie également sur des déclarations d’un ancien salarié d’OpenAI, qui a révélé sur la plateforme X (ex-Twitter) que sa mission consistait à faire écrire par l’intelligence artificielle les deux derniers tomes de la saga de George R. R. Martin.
Face à ces accusations, OpenAI invoque le concept de « fair use », défendant l’idée que l’entraînement d’une intelligence artificielle constitue un usage transformateur, potentiellement équitable. Le « fair use » est une exception au droit d’auteur américain qui permet, dans certaines circonstances, d’utiliser une œuvre protégée sans obtenir l’autorisation de son titulaire. Les entreprises soutiennent que les œuvres ne sont pas simplement reproduites, mais utilisées pour entraîner des modèles capables de générer de nouveaux contenus.
Cependant, cette défense ne répond pas à la question de l’origine des œuvres utilisées. Les auteurs cherchent à distinguer l’utilisation des livres pour entraîner une IA de la manière dont OpenAI aurait acquis ces ouvrages. Pour renforcer leur position, ils se basent sur une décision récente concernant Anthropic, un autre acteur majeur du secteur. En juin 2025, un juge américain a statué que l’utilisation de livres acquis légalement pour entraîner une IA pouvait relever du fair use, mais a également affirmé que le téléchargement de livres piratés constituait une violation distincte du droit d’auteur.
Source : Presse Citron.

