Zhipu AI et Alibaba lancent GLM-5.3 Flash et Qwen-3.8 Flash Next, des LLM pour l’inférence à bas coût
Hier, le 26 août 2026, Zhipu AI (zAI) et Alibaba ont présenté GLM-5.3 Flash et Qwen-3.8 Flash Next, deux modèles de langage (LLM) conçus pour des applications agentiques. Ces modèles, qui portent la mention « Flash », indiquent qu’ils sont plus rapides, moins coûteux ou plus légers que la moyenne.
GLM-5.3 Flash, le premier modèle multimodal de la collection GLM 5, active 18 milliards de ses 320 milliards de paramètres lors de l’inférence. Qwen-3.8 Flash Next, quant à lui, possède 125 milliards de paramètres, en activant seulement 6 milliards à l’inférence, en plus de 51 milliards de paramètres associés aux embeddings n-grammes. Les deux modèles offrent une fenêtre de contexte pouvant atteindre jusqu’à 1 million de tokens.
Les deux entreprises visent à réduire les coûts d’inférence. Alibaba a également annoncé qu’elle posait les bases de l’architecture de Qwen 4, en visant une avancée vers l’intelligence générale artificielle (AGI).
La version « low-cost » de GLM-5.3 ne démérite pas, selon Artificial Analysis
Pour GLM-5.3 Flash, zAI utilise une combinaison d’attention linéaire et éparse pour diminuer les coûts, en particulier avec des données d’entrée volumineuses. La startup a intégré le framework Manifold Contrained Hyper Connections (mHC), développé par DeepSeek, pour stabiliser les entraînements tout en connectant davantage de neurones. Le pipeline de données a été ajusté pour utiliser 30 000 milliards de tokens lors de l’entraînement.
GLM-5.3 Flash présente un score de 57 points sur l’Intelligent Index d’Artificial Analysis, contre 60 points pour GLM-5.3. Il est ainsi comparable à Muse Spark 1.2 de Meta et à GPT-5.6 Terra. Zhipu AI facture GLM-5.3 Flash à 0,15 dollar pour 1 million de tokens en entrée et 0,50 dollar pour le même volume en sortie, soit environ 90 % moins cher que GLM-5.3.
À la tâche, GLM-5.3 Flash coûte 0,09 dollar, tandis que son prédécesseur coûte 0,68 dollar. Cependant, le modèle génère 149 millions de tokens en sortie, ce qui est 10 % de moins que GLM-5.3.
Un inconvénient notable de GLM-5.3 Flash est sa lenteur, à 50 tokens par seconde, comparé à 329 tokens par seconde pour Gemini 3.7 Flash. Les performances en dehors des infrastructures de zAI, qui utilise des puces IA chinoises, restent à évaluer sur des puces Nvidia.
Les résultats des tests pour Qwen 3.8 Flash Next n’ont pas encore été publiés. Ce modèle est facturé 0,16 dollar par million de tokens en entrée et 0,47 dollar pour le même volume en sortie. Les tests d’Alibaba le placent légèrement au-dessus de Qwen-3.8 27B.
Qwen 3.8 Flash Next, un candidat intéressant pour l’inférence locale en entreprise
Alibaba a optimisé l’architecture de Qwen 3.8 Flash Next pour des scénarios déconnectés, en utilisant Gated DeltaNet, une évolution de l’attention linéaire. Ce mécanisme permet de mettre à jour le contexte de manière sélective tout en compressant l’historique. En outre, Alibaba utilise des vecteurs n-grammes pour encoder les mots, ce qui accélère la prédiction.
Les chercheurs ont conditionné l’appel à ces embeddings n-grammes à la couche 2 de Qwen 3.8 Flash Next, au moment du décodage. Un utilisateur a testé le modèle sur un serveur équipé de deux RTX 6000 Blackwell, générant 65 tokens par seconde avec une efficacité énergétique améliorée.
Reste à déterminer si ces optimisations affectent négativement les résultats dans des cas d’usage réels.
Source : Le Mag IT

