Benchmark

août 2026

À la mi-août 2026, le peloton frontier a bougé : Claude Opus 5 (24 juillet), GPT-5.6 Sol (9 juillet), Grok 4.6 (12 août), Kimi K3 (fin juillet). Voici le tableau qu’on peut tenir — uniquement les chiffres qu’on a, pas une synthèse magique. Personne ne gagne toutes les colonnes. Le vrai gagnant, encore une fois, c’est le routeur.

Dans cet article : l’index, les prix, une lecture par modèle, et ce que ça change pour un stack. En résumé :

  • 🥇 Index : Claude Opus 5 à 63. Fable 5 à 62. Grok 4.6 et GPT-5.6 Sol à 61. Kimi K3 ~59,7.
  • 🥇 Prix : Grok 4.6 à 2 $ / 6 $. Opus 5 à 5 / 25. Sol à 5 / 30. Kimi ~3 / 15. Fable 5 à 10 / 50.
  • GLM-5.3 entre dans la conversation agents / cyber, mais son tarif n’est pas publié.
  • DeepSeek V4 Pro : parmi les moins chers du frontier, pas de ligne AA dans ce tableau.
  • Gemini 3.5 Pro : pas GA. Flagship public = toujours Gemini 3.1 Pro.
  • Personne ne gagne toutes les colonnes. Tu routes.

Quel est le meilleur modèle aujourd’hui ?

On ne mélange pas les benches. D’un côté l’Artificial Analysis Intelligence Index (composite). De l’autre, le prix entrée / sortie au million de tokens. Ce n’est plus qui est le plus intelligent — c’est selon quelle lane.

Cinq noms dans le tableau : Claude Opus 5 (Anthropic), Claude Fable 5 (Anthropic, trophy), Grok 4.6 (SpaceXAI), GPT-5.6 Sol (OpenAI), Kimi K3 (Moonshot). GLM-5.3 n’a pas de case prix. DeepSeek V4 Pro n’a pas de ligne AA ici.

Le tableau

Uniquement les chiffres qu’on a. Pas de synthèse magique.

Indicateur Claude Opus 5 Claude Fable 5 Grok 4.6 GPT-5.6 Sol Kimi K3
AA Intelligence Index 🥇 63 62 61 61 ~59,7
Prix in / out (1M tokens) 5 $ / 25 $ 10 $ / 50 $ 🥇 2 $ / 6 $ 5 $ / 30 $ ~3 $ / 15 $

GLM-5.3 : prix non publié — pas de case. DeepSeek V4 Pro : parmi les moins chers du frontier, pas de ligne AA dans ce tableau.

Personne ne gagne toutes les colonnes. Le vrai gagnant, encore une fois, c’est le routeur.

🥇 Index : Opus 5 (63) — c’est le « plus fort » du composite, pas le moins cher. Tu le sors quand la qualité prime sur la facture. 🥇 Prix : Grok 4.6 (2 / 6) — même AA que Sol (61), une fraction du coût sortie. Tes boucles agents, c’est lui que tu testes en premier pour le volume. Sol à 5 / 30 pour le même 61 : tu le paies si tu veux l’écosystème ChatGPT / le debug agentique OpenAI, pas parce qu’il « gagne l’index ». Kimi ~59,7 à ~3 / 15 : un cran en dessous sur l’AA, vivant sur le long-horizon. Fable 5 à 62 et 10 / 50 : plus cher qu’Opus 5, moins fort sur l’index qu’on retient ici. Le trophy n’est plus le défaut.

Claude Opus 5 — le meilleur quotidien

Opus 5 en tête de l’index (63) — devant Fable 5 (62), Grok 4.6 et Sol (61), Kimi K3 (~59,7). API claude-opus-5, claude.ai, Claude Code, Bedrock, Vertex, Foundry, Copilot depuis le 24 juillet 2026. 5 $ / 25 $ le million. Verdict : Opus 5 en défaut « intelligent / quotidien ».

Grok 4.6 — le meilleur prix frontier

Grok 4.6 a rattrapé Sol sur l’AA — 61 partout, à 2 $ / 6 $ contre 5 $ / 30 $. Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare depuis le 12 août 2026. Le moins cher du tableau. Verdict : cheap frontier et agents longs.

GPT-5.6 Sol — la famille grand public

ChatGPT Plus / Pro / Business / Enterprise depuis le 9 juillet 2026. Sol Pro sur les plans du haut. 61 sur l’index, 5 $ / 30 $, une pile Sol / Terra / Luna. Tu le paies si tu veux l’écosystème ChatGPT / le debug agentique OpenAI, pas parce qu’il « gagne l’index ». Verdict : Sol quand le debug agentique OpenAI te parle.

Kimi K3 — le long-horizon open-weight

Kimi K3 n’est pas le leader AA — ~59,7, mais c’est le cran long-horizon / open-weight à ~3 $ / 15 $. Poids ouverts vers le 27 juillet. Self-host = infra lourde. Verdict : le spécialiste, pas le podium.

Disponibilité — ce que tu peux appeler

  • GPT-5.6 Sol : ChatGPT Plus / Pro / Business / Enterprise depuis le 9 juillet 2026. Sol Pro sur les plans du haut.
  • Grok 4.6 : Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare (12 août 2026).
  • Claude Opus 5 : API claude-opus-5, claude.ai, Claude Code, Bedrock, Vertex, Foundry, Copilot (24 juillet 2026).
  • Kimi K3 : open-weight vers le 27 juillet, hébergé souvent cité à ~3 / 15. Self-host = infra lourde.
  • GLM-5.3 : API Z.ai / GLM Coding Plan / ZCode depuis le 14 août. Prix : non publié. Poids MIT : ~28 août, non garanti.
  • Gemini 3.5 Pro : pas GA. Flagship public = toujours Gemini 3.1 Pro.

Pourquoi c’est un moment charnière

En quatre mois, on est passé du tableau d’avril (GPT-5.5, Opus 4.7, DeepSeek V4, Kimi 2.6) à un peloton plus serré, plus agentique, plus tarifé au token. OpenAI a sorti une famille Sol / Terra / Luna. Anthropic a mis le frontier dans le défaut Max. SpaceXAI a collé un 61 à 2 / 6 et un Bot avec son propre ordi. Moonshot et DeepSeek tiennent l’open-weight. Google, lui, n’a pas encore livré 3.5 Pro.

Le message n’a pas changé depuis avril. Il s’est juste durci : si tu épouses un seul logo, tu paies trop ou tu perds une lane. Même thèse qu’en avril 2026 : tu routes.

Le vrai gagnant

Si tu es freelance, dev ou consultant, tu construis un routeur, pas une religion. Opus 5 en défaut « intelligent / quotidien », Grok 4.6 en cheap frontier et agents longs, Sol quand le debug agentique OpenAI te parle, Kimi K3 / DeepSeek V4 Pro quand tu veux de l’open-weight ou du volume SWE, Flash 3.6 quand c’est du cheap Google. Personne ne gagne tout.

🥇 Intelligence composite — Claude Opus 5 (63)
🥇 Prix frontier — Grok 4.6 (2 $ / 6 $)
🥇 Famille grand public — GPT-5.6 Sol / Terra / Luna
🥇 Long-horizon open-weight — Kimi K3
🥇 Coût / contrôle (hors tableau AA) — DeepSeek V4 Pro
🥇 Post-training / cyber (hors prix) — GLM-5.3

Planner / quotidien    → Claude Opus 5
Cheap frontier         → Grok 4.6
Agentic debug OpenAI   → GPT-5.6 Sol
Long-horizon SWE       → Kimi K3
Open-weights / on-prem → DeepSeek V4 Pro
Agents + cyber (API)   → GLM-5.3
Volume Google          → Gemini 3.6 Flash
Flagship Google public → Gemini 3.1 Pro (3.5 Pro : pas GA)

Ce type d’orchestration crée un avantage durable. Un seul modèle, c’est confortable. C’est aussi trop cher ou trop faible sur au moins une lane. AI orchestration > AI model. Le futur appartient aux stacks capables de router intelligence, coût, latence, contexte et contrôle. On le disait en avril. On le ressort en août, avec un peloton plus serré et un Google qui n’a pas encore mis 3.5 Pro sur la ligne de départ.

Pour le virage « pro » d’OpenAI au printemps, c’est toujours ChatGPT 5.4. Pour l’état d’avril, le benchmark GPT-5.5 / Opus 4.7 / DeepSeek V4 / Kimi 2.6. Pour le flagship Google encore public, Gemini 3.1 Pro.

Sources : Artificial Analysis Intelligence Index (chiffres cités ci-dessus), tarifs éditeurs (Grok 4.6, Opus 5, Sol, Kimi), lancements juillet–août 2026.

Articles de la même catégorie