GLM-5.3-Flash sort de l’ombre après le buzz Ox Alpha
Le modèle d’intelligence artificielle « Ox Alpha », qui a suscité un grand intérêt depuis son apparition le 20 août sur OpenRouter et OpenCode, n’est autre que le nom de test de GLM-5.3-Flash, la dernière version de la famille GLM développée par Z.ai. Au cours de sa phase de test, Ox Alpha a rapidement grimpé en tête des modèles les plus utilisés sur la plateforme, attirant l’attention de figures influentes, dont Patrick Collison, PDG de Stripe, qui a qualifié ses performances de « très impressionnantes ».
Z.ai a affirmé avoir servi jusqu’à 100 000 milliards de tokens par jour durant cette période, en utilisant des accélérateurs d’intelligence artificielle chinois, une information significative dans le contexte des restrictions américaines sur les GPU avancés. Le modèle GLM-5.3-Flash se distingue par ses 320 milliards de paramètres, bien qu’il n’active que 18 milliards à chaque token. Il est capable de traiter du texte, des images et des vidéos, avec un contexte d’un million de tokens, tout en combinant attention linéaire et attention sparse pour optimiser le coût de l’inférence longue.
Cette annonce intervient après que Z.ai ait lancé GLM-5.3 le 14 août sans publier immédiatement ses poids, une décision motivée par des préoccupations de sécurité. La société a constaté que les capacités offensives du modèle avaient progressé plus rapidement que prévu, augmentant son score sur ExploitBench de 24,4 % à 54,4 %. Les poids de GLM-5.3-Flash, en revanche, sont déjà disponibles sous licence MIT, signalant une évolution vers une architecture conçue pour gérer à la fois la capacité, le coût et le déploiement.
La concurrence dans le secteur reste intense, avec des entreprises comme DeepSeek, Moonshot et Alibaba lançant de nouveaux modèles et renforçant leurs offres. Ox Alpha a fait du bruit en raison de son mystère, mais GLM-5.3-Flash pourrait engendrer un impact plus significatif maintenant qu’il est accessible pour des tests concrets.
Source : Informatiquenews.fr

