Le classement WebDev Arena, qui évalue les modèles d’IA sur les tâches de développement web, connaît une nouvelle recomposition en septembre 2026. Claude Fable 5.1 Max, tout juste lancé, prend la tête du classement général et du front-end. Derrière, les modèles chinois restent en embuscade, en particulier sur le volet fullstack.
Claude Fable 5.1 Max domine très largement le classement général
Claude Fable 5.1 Max s’installe en tête de la WebDev Arena avec un score de 1 765. Lancé le 1er septembre, le modèle embarque des garde-fous cyber assouplis et une baisse de prix sur la lecture du cache. L’écart avec le deuxième du classement dépasse 75 points, une avance rare sur ce classement où les positions se jouent habituellement à quelques points près.
Le reste du top 10 confirme l’installation des laboratoires chinois, qui occupent la moitié des dix premières places. Qwen3.8-max-0902, d’Alibaba, se classe deuxième devant Claude Opus 5 Max, leader du mois précédent, qui recule à la troisième position. Kimi K3 Max, de Moonshot, et Qwen3.8 Max suivent en quatrième et cinquième position. Grok 4.6 High, de SpaceXAI, fait une entrée remarquée en septième position, en net progrès par rapport à Grok 4.5.
Voici les 10 modèles d’IA les plus performants pour le code et le développement web en septembre 2026 :
- Claude Fable 5.1 Max (Anthropic) : 1 765 (score Elo)
- Qwen3.8-max-0902 (Alibaba) : 1 688
- Claude Opus 5 Max (Anthropic) : 1 687
- Kimi K3 Max (Moonshot) : 1 674
- Qwen3.8 Max (Alibaba) : 1 669
- Claude Opus 5 High (Anthropic) : 1 661
- Grok 4.6 High (SpaceXAI) : 1 629
- Claude Fable 5 (Anthropic) : 1 628
- Hy4-preview (Tencent) : 1 626
- Qwen3.8 Flash Next (Alibaba) : 1 622
Qwen prend la tête du fullstack Comme nous l’expliquions le mois dernier, le classement agrège désormais deux volets distincts : front-end et fullstack. Sur le seul volet front-end, Claude Fable 5.1 Max reste largement en tête, devant Claude Opus 5 Max et Qwen3.8-max-0902. Le classement par technologie confirme cette avance : Fable 5.1 Max domine aussi en React et en HTML. Sur le volet fullstack, la hiérarchie s’inverse. Claude Fable 5.1 Max sort du top 10. Qwen3.8 Max prend la tête, devant Claude Opus 5 Max, Kimi K3 Max, Claude Opus 5 High et GLM 5.3 Max. Claude Fable 5, la version précédente d’Anthropic, occupe la septième position. DeepSeek fait son entrée dans le top 10 avec deux modèles, en neuvième et dixième position. La WebDev Arena fonctionne par duels anonymisés. Deux modèles reçoivent la même consigne, produisent chacun leur réponse, et les internautes désignent celle qu’ils jugent la plus aboutie sans connaître l’identité des concurrents. Ces choix alimentent un score Elo, emprunté aux échecs, où battre un modèle mieux placé rapporte plus de points qu’une victoire face à un adversaire moins bien noté. Ce mode d’évaluation a ses limites. Le vote porte sur un rendu apprécié après une seule requête, pas sur la maintenabilité du code produit ni son comportement dans un projet existant. La colonne « rank spread » du tableau donne une fourchette de positions pour chaque modèle, souvent large pour les entrants récents ou les scores encore préliminaires. Ces classements servent donc à établir une liste de candidats à tester, pas à trancher seuls le choix d’un modèle pour une équipe de développement.

Comment fonctionne le classement de la WebDev Arena
Source : Blog du Modérateur.

