En août 2026, Arena, une plateforme spécialisée dans le classement des modèles d’intelligence artificielle (IA), a mis à jour ses leaderboards. Les performances des IA sont désormais évaluées dans plusieurs catégories, notamment Agent, Chat, Code, Image et Vidéo. Le classement Chat, qui est au centre de cet article, se concentre sur les compétences text-to-text des modèles, incluant des domaines variés tels que les mathématiques, le code et l’écriture créative.
Claude domine le classement
Anthropic a réussi à placer six de ses modèles dans les sept premières positions du classement. Claude Fable 5, suivi de Claude Opus 4.6 High et Claude Opus 4.7 High, occupe les trois premières places. Muse Spark 1.2 xHigh, un modèle récent de Meta, se classe quatrième, tandis que Qwen 3.8-max d’Alibaba et Gemini 3.7 Flash High de Google se positionnent respectivement en huitième et neuvième places. Claude Opus 5 Max complète ce top 10, soulignant la domination d’Anthropic dans cette édition d’août.
À noter l’absence d’OpenAI, qui ne parvient à placer ChatGPT qu’à deux reprises dans le top 20, avec GPT-5.5 High à la 17e place et GPT-5.6 Sol xHigh à la 19e.
Voici le top 20 des modèles de langage les plus performants de la Text Arena en août 2026 :
- Claude Fable 5
- Claude Opus 4.6 High
- Claude Opus 4.7 High
- Muse Spark 1.2
- Claude Opus 4.6
- Claude Opus 4.7
- Claude Opus 5 High
- Qwen 3.8 Max
- Gemini 3.7 Flash High
- Claude Opus 5 Max
- Muse Spark 1.1
- Kimi K3 Max
- Muse Spark
- Gemini 3.1 Pro Preview
- Gemini 3 Pro
- Gemini 3.6 Flash High
- GPT-5.5 High
- Claude Opus 4.8 High
- GPT-5.6 Sol xHigh
- Gemini 3.5 Flash High
Classements spécialisés : Recherche, Vision et Document
Le classement Chat se divise en trois sous-catégories : Search, Vision et Document Arena. Dans la catégorie Search, Claude Opus 4.6 Search d’Anthropic se classe premier, suivi de GPT-5.5 Search et de Claude Fable 5. Concernant la Vision, Claude Fable 5 se positionne également en tête, avec Qwen 3.8 Max en deuxième place et Claude Opus 4.7 High en troisième. Pour la Document Arena, Anthropic domine avec Claude Opus 5 High, suivi de Claude Opus 4.6 et Claude Opus 4.6 High occupant les six premières places.

Méthodologie du classement de la Text Arena
Arena s’appuie sur sa communauté pour évaluer les modèles. Le processus repose sur des affrontements en aveugle, où deux modèles répondent au même prompt sans être identifiés, et l’utilisateur choisit la réponse la plus convaincante. Les résultats de ces votes génèrent un score Elo, qui fluctue en fonction des performances des modèles au cours des duels.
Source : Arena.ai



