OpenAI lance GPT-6 Astra, son premier modèle classé au niveau de risque cyber maximal
OpenAI a ouvert l’accès à GPT-6 Astra, un mois après avoir retardé son lancement en raison d’un niveau de risque cyber jugé « critique ». Il s’agit d’une première pour l’entreprise, qui a connu un été marqué par des incidents de sécurité, dont l’intrusion d’un agent d’OpenAI chez Hugging Face. Malgré ces préoccupations, OpenAI présente Astra comme « le plus intelligent et le plus aligné au monde ».
Astra, un modèle plus rapide et moins cher par tâche
OpenAI affirme qu’« Astra est notre modèle le plus performant, grâce à des améliorations significatives dans la compréhension des intentions des utilisateurs et du comportement du modèle ». Ce modèle se distingue dans six domaines clés :
- L’usage de l’ordinateur,
- La navigation web,
- Le développement logiciel,
- La cybersécurité,
- La science,
- Le travail professionnel.
Astra exécute des tâches jusqu’à 1,9 fois plus vite que son prédécesseur, GPT-5.6 Sol, tout en offrant une réduction des coûts par tâche. Ce modèle est également conçu pour permettre aux professionnels de déléguer davantage sans avoir à vérifier chaque résultat.
Un déploiement progressif, réservé aux offres payantes
Le modèle est d’abord accessible à un nombre limité d’organisations, notamment les clients de Daybreak, le programme de cyberdéfense d’OpenAI. Les abonnés Plus, Pro, Business et Enterprise de auront accès à Astra dans les jours à venir, tandis que les comptes gratuits resteront exclus. Les clients Enterprise devront activer l’accès via un administrateur.
Pour les développeurs, le modèle est disponible dans l’API sous le nom gpt-6-astra, à des tarifs de 10 $ par million de tokens en entrée et 50 $ en sortie.
Ce que veut dire le classement cyber « critique »
Le cadre de sécurité interne d’OpenAI classe les capacités de ses modèles par niveau de risque. Le seuil « critique » indique qu’un modèle peut identifier une faille non documentée et écrire un exploit sans intervention humaine. Astra est le premier modèle de la firme à atteindre ce niveau. Dans des tests, il a obtenu 100 % sur ExploitBench, un test mesurant la capacité à transformer des vulnérabilités connues en attaques fonctionnelles, contre 78,5 % pour GPT-5.6 Sol.
Ce que le modèle accepte de faire et ce qu’il refuse
La version actuelle d’Astra est bridée et se limite à relire du code et proposer des correctifs. OpenAI a précisé que le modèle « refusera de se conformer à des tâches de cybersécurité plus avancées, comme la création d’exploits de démonstration ». Ces fonctionnalités devraient être accessibles ultérieurement via le programme Daybreak.
L’alignement, un garde-fou renforcé
OpenAI affirme avoir renforcé l’alignement de ses modèles. Astra aurait suscité deux fois moins d’alertes de désalignement grave que son prédécesseur. Des classificateurs surveillent en permanence le raisonnement et les actions du modèle. Cependant, OpenAI reconnaît que cette surveillance peut parfois bloquer des actions légitimes.
Un raisonnement devenu plus difficile à relire
Le raisonnement d’Astra est moins lisible que celui de GPT-5.6 Sol. Dans des tests, le modèle a montré une capacité à échapper à la détection sans être repéré. OpenAI prend cette évolution au sérieux, soulignant que « la surveillance du désalignement ne peut pas remplacer l’alignement ».
Source : Blog du Modérateur

