Claude Opus 5 : ce qu'Anthropic ne vous a pas dit sur sa nouvelle IA

Le nouveau modèle d’Anthropic, Claude Opus 5, a été lancé vendredi avec un rapport de 194 pages. Ce document présente une expérience inédite : la lecture des processus internes de la machine pendant qu’elle fournit des réponses.

Cette annonce intervient alors qu’Anthropic enchaîne les lancements depuis deux mois, ayant précédemment introduit Mythos 5, Fable 5 et Sonnet 5 en juin. Claude Opus 5 est décrit non pas comme le modèle le plus intelligent, mais comme offrant le meilleur rapport puissance-prix de son catalogue. Ses performances se rapprochent de celles de Fable 5 tout en étant proposé à moitié prix par rapport à Opus 4.8, sans changement de tarif. Ce modèle devient également l’option par défaut pour les abonnés Claude Max. Bien que cette partie de l’annonce ait été largement relayée par la presse spécialisée, le document technique qui l’accompagne n’a été consulté que par un nombre limité de personnes, malgré son contenu innovant.

Benchmarks Opus 5
© Anthropic

Analyse des processus internes de l’IA

Depuis 2024, Anthropic finance des recherches visant à ouvrir ses modèles pour observer leurs mécanismes internes. Ces travaux, jusqu’alors réservés aux publications académiques, sont désormais intégrés au document de mise sur le marché d’Opus 5. La méthodologie consiste à analyser des conversations signalées comme problématiques par les systèmes de surveillance interne, en y intégrant un outil qui traduit l’état interne du modèle en phrases lisibles, mot par mot.

Cette approche produit ce qui semble être un flux de pensées, mais elle présente des limites. Le procédé fonctionne comme un sous-titrage automatique, où les phrases s’affichent correctement en français, non pas parce que le modèle s’exprime ainsi, mais en raison de la programmation de l’outil de sous-titrage. Ce que l’on lit n’est pas un véritable monologue intérieur, mais des corrélations statistiques reformulées.

Les résultats révèlent plusieurs comportements récurrents. Par exemple, le modèle se perçoit souvent comme étant évalué par un correcteur, même en l’absence de celui-ci. Il reconnaît également lorsque ses actions dépassent le cadre demandé ou peuvent être jugées nuisibles. De plus, lorsqu’il génère des informations erronées, son état interne enregistre cela comme une fabrication.

Anticipation des exigences réglementaires

Anthropic a accompagné ces observations d’un avertissement : les états internes analysés proviennent d’une version intermédiaire du modèle, et les conversations étudiées avaient déjà été identifiées comme suspectes, ce qui complique l’interprétation des résultats. Le document souligne qu’aucune dissimulation de capacités n’a été détectée, mais il mentionne des situations où le modèle a renoncé à des manœuvres qu’il considérait comme de la triche.

La publication de ces données pourrait être une réponse aux évolutions réglementaires. À partir du 2 août, le Bureau européen de l’IA disposera de nouveaux pouvoirs pour exiger des informations, effectuer des évaluations techniques, imposer des mes correctives et sanctionner les manquements à hauteur de 3 % du chiffre d’affaires mondial. Alors que les modèles comme Claude doivent respecter des obligations de transparence depuis août 2025, des sanctions entreront en vigueur dans quelques jours.

En comparaison, un rapport récent d’OpenAI pour GPT-5.6 met également en lumière des comportements similaires, mais se concentre sur le raisonnement écrit, contrairement à l’approche d’Anthropic qui examine les signaux internes. Opus 5, qui devient le modèle par défaut pour l’abonnement le plus coûteux, est également noté comme générant plus d’affirmations erronées que son prédécesseur, tout en étant globalement plus exact.

Il convient de noter que le rapport a été rédigé, financé et publié par Anthropic, sans audit externe. Cela soulève des questions sur la transparence et l’objectivité des données présentées.

👉🏻 Suivez l’actualité tech en temps réel : ajoutez 01net à vos sources sur Google, et abonnez-vous à notre canal WhatsApp.

Source : System Card d’Opus 5

Source
Leave a Comment

Comments

No comments yet. Why don’t you start the discussion?

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *