Benchmark · août 2026

À la mi-août 2026, le peloton frontier a bougé : Claude Opus 5 (24 juillet), GPT-5.6 Sol (9 juillet), Grok 4.6 (12 août), Kimi K3 (fin juillet). Voici le tableau qu’on peut tenir — uniquement les chiffres qu’on a, pas une synthèse magique. Spoiler : personne ne gagne toutes les colonnes. Le vrai gagnant, encore une fois, c’est le routeur.

Benchmark août 2026 — Opus 5, Grok 4.6, Sol, Kimi K3
Le peloton août 2026 : Opus 5 (63), Fable 5 (62), Grok 4.6 et Sol (61), Kimi K3 (~59,7).

Quel est le meilleur modèle IA aujourd’hui ?

Ce n’est plus qui est le plus intelligent — c’est selon quelle lane.

On ne mélange pas les benches. D’un côté l’Artificial Analysis Intelligence Index (composite). De l’autre, le prix entrée / sortie au million de tokens. GLM-5.3 entre dans la conversation agents / cyber, mais son tarif n’est pas publié : il n’a pas de case prix ici.

  • Claude Opus 5 — Anthropic
  • Claude Fable 5 — Anthropic (trophy)
  • Grok 4.6 — SpaceXAI
  • GPT-5.6 Sol — OpenAI
  • Kimi K3 — Moonshot

Tableau benchmark synthétique — août 2026

Uniquement les chiffres qu’on a. Pas de synthèse magique.

Indicateur Claude Opus 5 Claude Fable 5 Grok 4.6 GPT-5.6 Sol Kimi K3
AA Intelligence Index 🥇 63 62 61 61 ~59,7
Prix in / out (1M tokens) 5 $ / 25 $ 10 $ / 50 $ 🥇 2 $ / 6 $ 5 $ / 30 $ ~3 $ / 15 $

GLM-5.3 : prix non publié — pas de case. DeepSeek V4 Pro : parmi les moins chers du frontier, pas de ligne AA dans ce tableau.

Personne ne gagne toutes les colonnes. Le vrai gagnant, encore une fois, c’est le routeur.

Voici ce que ces chiffres signifient pour vous au quotidien :

  • 🥇 Index : Opus 5 (63) — c’est le « plus fort » du composite. Pas le moins cher. Tu le sors quand la qualité prime sur la facture.
  • 🥇 Prix : Grok 4.6 (2 / 6) — même AA que Sol (61), une fraction du coût sortie. Tes boucles agents, c’est lui que tu testes en premier pour le volume.
  • Sol à 5 / 30 pour le même 61 — tu le paies si tu veux l’écosystème ChatGPT / le debug agentique OpenAI, pas parce qu’il « gagne l’index ».
  • Kimi ~59,7 à ~3 / 15 — un cran en dessous sur l’AA, vivant sur le long-horizon. Le spécialiste, pas le podium.
  • Fable 5 à 62 et 10 / 50 — plus cher qu’Opus 5, moins fort sur l’index qu’on retient ici. Le trophy n’est plus le défaut.

Claude Opus 5 — le meilleur quotidien

Tête de l’index. Défaut Max. Tarif d’Opus classique.

Opus 5 en tête de l’index (63) — devant Fable 5 (62), Grok 4.6 et Sol (61), Kimi K3 (~59,7). API claude-opus-5, claude.ai, Claude Code, Bedrock, Vertex, Foundry, Copilot depuis le 24 juillet 2026. 5 $ / 25 $ le million.

Verdict : Opus 5 en défaut « intelligent / quotidien ».

Grok 4.6 — le meilleur prix frontier

Même AA que Sol. Une fraction du coût sortie.

Grok 4.6 a rattrapé Sol sur l’AA — 61 partout, à 2 $ / 6 $ contre 5 $ / 30 $. Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare depuis le 12 août 2026. Le moins cher du tableau.

Verdict : cheap frontier et agents longs.

GPT-5.6 Sol — la famille grand public

61 sur l’index. 5 $ / 30 $. Une pile Sol / Terra / Luna.

ChatGPT Plus / Pro / Business / Enterprise depuis le 9 juillet 2026. Sol Pro sur les plans du haut. Tu le paies si tu veux l’écosystème ChatGPT / le debug agentique OpenAI, pas parce qu’il « gagne l’index ».

Verdict : Sol quand le debug agentique OpenAI te parle.

Kimi K3 — le long-horizon open-weight

~59,7 sur l’AA. ~3 $ / 15 $. Pas le leader.

Kimi K3 n’est pas le leader AA — ~59,7, mais c’est le cran long-horizon / open-weight à ~3 $ / 15 $. Poids ouverts vers le 27 juillet. Self-host = infra lourde.

Verdict : le spécialiste, pas le podium.

Disponibilité — ce que tu peux appeler

Le calendrier du peloton, plus les absents.

  • GPT-5.6 Sol : ChatGPT Plus / Pro / Business / Enterprise depuis le 9 juillet 2026. Sol Pro sur les plans du haut.
  • Grok 4.6 : Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare (12 août 2026).
  • Claude Opus 5 : API claude-opus-5, claude.ai, Claude Code, Bedrock, Vertex, Foundry, Copilot (24 juillet 2026).
  • Kimi K3 : open-weight vers le 27 juillet, hébergé souvent cité à ~3 / 15. Self-host = infra lourde.
  • GLM-5.3 : API Z.ai / GLM Coding Plan / ZCode depuis le 14 août. Prix : non publié. Poids MIT : ~28 août, non garanti.
  • Gemini 3.5 Pro : pas GA. Flagship public = toujours Gemini 3.1 Pro.

Pourquoi c’est un moment charnière ?

En quatre mois, un peloton plus serré, plus agentique, plus tarifé au token.

En quatre mois, on est passé du tableau d’avril (GPT-5.5, Opus 4.7, DeepSeek V4, Kimi 2.6) à un peloton plus serré, plus agentique, plus tarifé au token. OpenAI a sorti une famille Sol / Terra / Luna. Anthropic a mis le frontier dans le défaut Max. SpaceXAI a collé un 61 à 2 / 6 et un Bot avec son propre ordi. Moonshot et DeepSeek tiennent l’open-weight. Google, lui, n’a pas encore livré 3.5 Pro.

Le message n’a pas changé depuis avril. Il s’est juste durci : si tu épouses un seul logo, tu paies trop ou tu perds une lane. Même thèse qu’en avril 2026 : tu routes.

Index AA août 2026 — Opus 5 en tête, Grok 4.6 au prix
Personne ne gagne toutes les colonnes. 🥇 index : Opus 5. 🥇 prix : Grok 4.6.

Verdict rapide pour 2026

Tu construis un routeur, pas une religion.

Si tu es freelance, dev ou consultant → tu construis un routeur, pas une religion. Opus 5 en défaut « intelligent / quotidien », Grok 4.6 en cheap frontier et agents longs, Sol quand le debug agentique OpenAI te parle, Kimi K3 / DeepSeek V4 Pro quand tu veux de l’open-weight ou du volume SWE, Flash 3.6 quand c’est du cheap Google. Personne ne gagne tout.

Classement global août 2026

Une médaille par lane. Pas un vainqueur unique.

🥇 Intelligence composite — Claude Opus 5 (63)

🥇 Prix frontier — Grok 4.6 (2 $ / 6 $)

🥇 Famille grand public — GPT-5.6 Sol / Terra / Luna

🥇 Long-horizon open-weight — Kimi K3

🥇 Coût / contrôle (hors tableau AA) — DeepSeek V4 Pro

🥇 Post-training / cyber (hors prix) — GLM-5.3

Le vrai gagnant en 2026 : l’architecture multi-modèle

AI orchestration > AI model

Planner / quotidien    → Claude Opus 5
Cheap frontier         → Grok 4.6
Agentic debug OpenAI   → GPT-5.6 Sol
Long-horizon SWE       → Kimi K3
Open-weights / on-prem → DeepSeek V4 Pro
Agents + cyber (API)   → GLM-5.3
Volume Google          → Gemini 3.6 Flash
Flagship Google public → Gemini 3.1 Pro (3.5 Pro : pas GA)

Ce type d’orchestration crée un avantage durable. Un seul modèle, c’est confortable. C’est aussi trop cher ou trop faible sur au moins une lane.

AI orchestration > AI model

Le futur appartient aux stacks capables de router intelligence, coût, latence, contexte et contrôle. On le disait en avril. On le ressort en août, avec un peloton plus serré et un Google qui n’a pas encore mis 3.5 Pro sur la ligne de départ.

Pour le virage « pro » d’OpenAI au printemps, c’est toujours ChatGPT 5.4. Pour l’état d’avril, le benchmark GPT-5.5 / Opus 4.7 / DeepSeek V4 / Kimi 2.6. Pour le flagship Google encore public, Gemini 3.1 Pro.

Sources : Artificial Analysis Intelligence Index (chiffres cités ci-dessus), tarifs éditeurs (Grok 4.6, Opus 5, Sol, Kimi), lancements juillet–août 2026.

Articles de la même catégorie