Anthropic maintient sa position dominante dans le développement web. Selon le classement WebDev Arena, qui évalue les modèles d’IA sur les tâches de développement front-end, Claude Opus 5 est en tête de l’édition d’août 2026. En juillet, Claude Fable 5 occupait la première place. Ce classement d’été met en lumière la montée en puissance des laboratoires chinois et une révision des catégories de classement d’Arena.
Opus 5 en tête, 4 laboratoires chinois dans les 8 premiers
Claude Opus 5 Max se positionne en première place de la WebDev Arena. Lancé le 24 juillet, ce modèle est présenté par Anthropic comme étant en me de rivaliser avec l’intelligence de Fable 5 à un coût réduit. Sa version High se classe troisième, tandis que Fable 5, qui était en tête en juillet, recule à la cinquième position.
Le classement révèle également la montée des acteurs chinois, qui occupent désormais quatre des huit premières places. Kimi K3 Max, développé par Moonshot, se classe deuxième. Qwen3.8 Max d’Alibaba se positionne quatrième, juste derrière Opus 5 High. GLM 5.2 Max de Z.ai est septième et DeepSeek V4 Flash High, le modèle le plus économique du top 10, se classe huitième à 0,14 dollar par million de tokens en entrée.
Deux scores encore provisoires dans le top 10
Arena signale que les scores de Qwen3.8 Max et DeepSeek V4 Flash High sont préliminaires, reposant respectivement sur 1 563 et 1 319 votes, contre plus de 6 000 pour Claude Fable 5. Leurs positions pourraient donc évoluer dans les semaines à venir.
Du côté américain, OpenAI reste en sixième position avec GPT-5.6 Sol xHigh, évalué via le harnais Codex. Google est absent du top 10, avec sa meilleure référence, Gemini 3.6 Flash, en dix-huitième position. Grok 4.5 de xAI chute de la quatrième à la douzième place.
Voici les 10 modèles d’IA les plus performants pour le code et le développement web en août 2026 :
- Claude Opus 5 Max (Anthropic) : 1 705 (score Elo)
- Kimi K3 Max (Moonshot) : 1 676
- Claude Opus 5 High (Anthropic) : 1 669
- Qwen3.8 Max (Alibaba) : 1 668
- Claude Fable 5 (Anthropic) : 1 630
- GPT-5.6 Sol xHigh (OpenAI) : 1 620
- GLM 5.2 Max (Z.ai) : 1 586
- DeepSeek V4 Flash High : 1 577
- Claude Opus 4.8 Thinking (Anthropic) : 1 566
- Claude Opus 4.7 (Anthropic) : 1 561
Découvrir le classement complet
Sur le fullstack, Kimi K3 devance les modèles d’Anthropic
Arena a récemment modifié ses classements thématiques. Les sous-classements par technologie, qui opposaient HTML et React, ont été remplacés par une distinction plus claire entre développement front-end et fullstack. L’environnement de test intègre désormais une base de données PostgreSQL, l’authentification des utilisateurs, la connexion à des services tiers via clé d’API, l’exécution de commandes bash et un déploiement direct sur Vercel. Cela signifie qu’il ne s’agit plus seulement de générer une interface en une requête, mais de livrer une application fonctionnelle.
Dans le classement fullstack, Kimi K3 Max est en première position, suivi de Claude Opus 5 High et GPT-5.6 Sol xHigh. Fable 5 se classe quatrième, tandis qu’Opus 5 Max, leader général, ne figure pas dans le top 10 de cette catégorie. Muse Spark 1.1 de Meta est septième, malgré une position générale de dix-septième, et Claude Sonnet 4.6 remonte au huitième rang.
Cette évolution a des implications pratiques pour les équipes techniques. Un modèle qui réussit dans un duel sur une page générée d’un seul jet ne garantit pas les mêmes résultats dans des contextes nécessitant la gestion d’une base de données, d’une authentification et d’une mise en production. Les votes étant encore peu nombreux dans cette nouvelle catégorie, les positions y sont donc plus instables que dans le classement général.
Comment fonctionne le classement de la WebDev Arena
La WebDev Arena fonctionne par le biais de duels anonymisés. Deux modèles reçoivent la même consigne, produisent chacun leur réponse, et les internautes choisissent celle qu’ils jugent la plus aboutie sans connaître l’identité des concurrents. Ces choix alimentent un score Elo, emprunté aux échecs et à l’e-sport, où battre un modèle mieux classé rapporte plus de points qu’une victoire contre un modèle moins bien noté.
Ce système d’évaluation présente des limites. Le vote se base sur un rendu après une seule requête, sans tenir compte de la maintenabilité du code, de son accessibilité ou de son intégration dans un projet existant. La colonne « rank spread » du tableau fournit également une fourchette de positions pour chaque modèle, souvent large pour les nouveaux entrants. Ces classements visent à établir une liste de candidats à tester, mais ne doivent pas être le seul critère pour choisir un modèle pour une équipe de développement.


