Qwen 3.8 27B : faut-il installer le nouveau modèle local d'Alibaba ?

Faut-il installer le nouveau modèle local d’Alibaba, Qwen 3.8 27B ?

Dévoilé par le laboratoire de recherche d’Alibaba, Qwen 3.8 27B se positionne comme un modèle open-source sous licence Apache 2 particulièrement prometteur. Conçu pour fonctionner sur du matériel grand public, il se distingue par un fichier quantifié de seulement 17 Go, tout en excelling dans la vision par ordinateur, la génération d’interfaces et le pilotage d’agents de code. Cependant, son niveau de raisonnement, réglé par défaut sur une valeur maximale, peut mener à une suranalyse, transformant des requêtes simples en processus longs et complexes.

La maîtrise des paramètres d’effort de raisonnement est essentielle pour éviter des latences excessives sur les machines personnelles.

Un poids plume aux ambitions de géant

Attendu par la communauté open-source, Qwen 3.8 27B succède au modèle Qwen 3.6 27B et surpasse plusieurs métriques de son prédécesseur, Qwen 3.7-Plus, un modèle propriétaire d’Alibaba encore en référence en mai dernier. Proposé sous licence permissive Apache 2, son architecture de 27 milliards de paramètres le rend idéal pour une exécution locale sur des machines performantes.

Des tests ont été réalisés sur deux configurations matérielles : un MacBook Pro M5 Max avec 128 Go de mémoire unifiée et une station de travail NVIDIA DGX Spark. Le modèle a été chargé via LM Studio en version quantifiée Q4_K_M, occupant 17 Go sur le disque dur, ainsi que directement via llama-server sur la DGX Spark.

Le piège du raisonnement « xhigh »

La documentation officielle de Qwen indique que le modèle s’exécute par défaut avec un paramètre de reasoning_effort configuré sur xhigh (très élevé), aux côtés de modes medium (équilibré) et low (optimisé pour la vitesse). Ce réglage s’avère excessif pour un usage personnel, entraînant des saturations rapides de la fenêtre de contexte.

Avec une limite par défaut de 8 192 jetons dans LM Studio, le modèle consommait la totalité du contexte même pour des consignes simples. En augmentant la fenêtre maximale à 262 144 jetons, les blocages ont été résolus, mais les temps de traitement demeurent vertigineux.

Exemples de performances

En mode xhigh, la génération d’un SVG a nécessité 21 minutes, utilisant 22 276 jetons de réflexion pour produire 3 223 jetons de code. En revanche, en désactivant le raisonnement, la même commande a été exécutée en seulement 137 secondes, générant 3 715 jetons.

Vision informatique et détection d’objets

Qwen 3.8 27B montre également des compétences en vision par ordinateur, capable de déterminer les boîtes englobantes d’une image avec une grande précision. Lors d’un test sur une photo de pélicans, le modèle a renvoyé des coordonnées JSON précises.

Exécution d’agents de code

Le modèle a été testé pour piloter une boucle d’agent de codage, démontrant sa capacité à gérer un large contexte et à rédiger du code propre. Lors d’un test sur le projet Datasette, l’agent a exploré plusieurs fichiers et fourni des réponses détaillées.

La quête de la vitesse

Le principal inconvénient de Qwen 3.8 réside dans sa vitesse d’exécution, affichant un débit moyen de 15 à 30 jetons par seconde. Ce rythme est en retrait par rapport aux API cloud, mais le modèle intègre la technologie de prédiction multi-jetons, permettant des gains de vitesse significatifs, jusqu’à 72 % par rapport à l’exécution standard sous LM Studio.

Conclusion

Qwen 3.8 27B représente une avancée notable dans le domaine des modèles open-source, mais son utilisation optimale nécessite une gestion fine de ses paramètres de raisonnement pour éviter des latences excessives. Les utilisateurs doivent donc évaluer leur matériel et leurs besoins avant de décider de l’installer.

Source : Intelligence-Artificielle

Source
Leave a Comment

Comments

No comments yet. Why don’t you start the discussion?

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *