Découvrez les nouveautés de Qwen 3.8-flash-next et ses performances optimisées
Qwen 3.8-flash-next, développé par Alibaba, se positionne comme un modèle avancé dans le domaine de l’intelligence artificielle grâce à son architecture hybride à grande échelle. Ce modèle intègre 125 milliards de paramètres, permettant un traitement rapide et optimisé des longues séquences. Il offre une fenêtre contextuelle native de 262 144 tokens, extensible jusqu’à un million, ce qui représente une avancée significative pour les applications nécessitant une gestion de contexte étendue.
Les performances de Qwen 3.8-flash-next sont particulièrement remarquables dans le domaine de l’agentic coding, où il excelle dans la gestion textuelle ainsi que dans le traitement d’images et de vidéos. Cette mise à jour technologique met en lumière des améliorations notables en matière de coût et de vitesse, tout en garantissant une qualité et une cohérence accrues des résultats.
En bref :
- Qwen 3.8-flash-next est un modèle multimodal avec 125 milliards de paramètres, dont 6 milliards activés par token.
- Il propose une fenêtre contextuelle native de 262 144 tokens, extensible à 1 million.
- Son architecture hybride optimise vitesse et efficacité grâce à une combinaison d’attention éparse et de réseaux DeltaNet.
- Le coût d’exécution est réduit, nécessitant seulement 1/9e des ressources de son prédécesseur tout en améliorant performance et rapidité.
- Compatible avec un usage local, il requiert un matériel puissant, tel qu’un Mac Studio 256GB ou un rig multi-GPU.
- Distribué sous la licence Qwen Community License 1.0, il permet des usages commerciaux spécifiques.
- L’API Qwen Cloud offre 1 million de tokens de contexte par défaut à un tarif compétitif.
Innovations majeures
L’architecture de Qwen 3.8-flash-next repose sur quatre innovations clés. La technologie Qwen Sparse Attention (QSA) réduit la latence en sélectionnant des micro-blocs de tokens, tandis qu’un tableau d’n-gram embedding à 51 milliards de paramètres améliore l’encodage des séquences courtes. Le module Gated DeltaNet linear-attention ajuste le flux d’informations, permettant une expressivité accrue. Enfin, la multi-token prediction (MTP) layer, avec 4 milliards de paramètres, facilite le décodage spéculatif.
Cette architecture permet de réduire le nombre d’opérations activées à seulement 6 milliards par token, tout en conservant une taille totale de 125 milliards de paramètres. Ce design est particulièrement adapté aux environnements à forte charge de travail.
Performances et benchmarks
Les performances de Qwen 3.8-flash-next ont été validées par des benchmarks reconnus. Sur SWE-bench Pro, il atteint un score de 62,5, surpassant la génération précédente, Qwen3.7-Plus, ainsi que d’autres modèles tels que DeepSeek-V4-Flash et Claude Opus 4.6. Sur LiveCodeBench v6, le modèle obtient un score de 91,9, illustrant ses capacités avancées dans la programmation automatisée.
La réduction de l’activation à 6 milliards par token permet d’accélérer le débit sans compromettre la qualité des réponses. Sur un Mac Studio M5 Ultra avec 256GB de RAM, la vitesse d’exécution est estimée à 32 tokens par seconde.
Exigences matérielles
Pour une utilisation locale, Qwen 3.8-flash-next nécessite une configuration matérielle avancée, avec un minimum de 256GB de mémoire unifiée. Les machines recommandées incluent le Mac Studio M5 Ultra et des configurations avec des GPU puissants, comme des RTX PRO 6000.
Conclusion
Qwen 3.8-flash-next offre une solution économique et performante pour le traitement multimodal et longue portée. Ses capacités avancées et son coût d’exploitation optimisé en font un choix stratégique pour les entreprises souhaitant intégrer des solutions d’intelligence artificielle dans leurs processus.
Source : Intelligence-Artificielle.com

