Modèles
12 août 2026
Le 12 août 2026, SpaceXAI a sorti Grok 4.6, le lendemain de Grok Bot. Le focus est clair : agents longue durée, travail interactif et visuel. Sur l’Artificial Analysis Intelligence Index, Grok 4.6 marque 61 — ex-æquo avec GPT-5.6 Sol Max, derrière Claude Fable 5 Max (62) et Claude Opus 5 (~63). Le message : SpaceXAI a rattrapé le flagship OpenAI sur l’index composite.
Dans cet article : ce que 4.6 change vraiment, la grille d’évals officielle, le prix, et où le coller dans un routeur. En résumé :
- AA Intelligence Index à 61 : tie avec GPT-5.6 Sol Max. Fable 5 Max à 62, Opus 5 autour de 63.
- Focus assumé : rester sur des tâches complexes à beaucoup d’étapes — recherche, repo, artefact fini.
- Prix affiché : 2 $ / 6 $ par million de tokens. Variante fast : le double.
- Disponible le jour J dans Cursor, Grok Build, l’API, OpenRouter, Vercel et Cloudflare.
- Grille officielle Grok 4.6 High : CursorBench v3.2 69,9 %, DeepSWE v1.1 65,9 %, FrontierCode 61,3 %, Terminal-Bench v3.0 26 %.
- GDPVal-AA v2 1753, APEX-Agents 57,5 %, APEX-SWE 56,4 %, AA-Briefcase 1577, Harvey LAB 15,8 %.
- Terminal-Bench à 26 % : ce n’est pas un score de roi du terminal. Tu routes.
Qu’est-ce que Grok 4.6 change ?
Grok 4.6 s’appuie sur Grok 4.5, avec un focus assumé : rester sur des tâches complexes à beaucoup d’étapes, que ce soit de la recherche, une codebase, ou une appli poussée jusqu’à un premier jet visuel. Ce n’est plus « un peu plus de chat ». Ce n’est pas juste un +0.1.
Le deuxième pilier annoncé, à côté des agents longs, c’est l’interactif / visuel plus ambitieux. Le lendemain de Grok Bot, le timing n’est pas un hasard : le modèle tient les trajectoires longues, le Bot a la machine. Les deux se parlent.
Les variantes
Le tarif de base est 2 $ in / 6 $ out par million de tokens. La variante fast coûte le double. Tu compares à Sol (5 / 30) et à Opus 5 (5 / 25) sans calculatrice. Une boucle agent qui parle beaucoup te coûte nettement moins : tu oses plus d’itérations avant de regarder la facture.
Côté évals officielles, Grok 4.6 High affiche GDPVal-AA v2 1753, CursorBench v3.2 69,9 %, DeepSWE v1.1 65,9 %, FrontierCode 61,3 %, APEX-Agents 57,5 %, Terminal-Bench v3.0 26 %, APEX-SWE 56,4 %, AA-Briefcase 1577, Harvey LAB 15,8 %. CursorBench te parle si tu codes dans l’IDE. DeepSWE et FrontierCode, c’est du SWE soutenu, pas un exo de 20 lignes. Terminal-Bench 26 %, c’est le trou à connaître : pour du CLI dur, tu ne prends pas 4.6 les yeux fermés. GDPVal-AA, AA-Briefcase et Harvey LAB disent que le signal knowledge-work est là — ce n’est pas qu’un modèle « code Twitter ».
Disponibilité
Le 12 août 2026, déjà dans les outils où tu codes : Cursor, Grok Build, API SpaceXAI, OpenRouter, Vercel, Cloudflare. Tarif 2 $ / 6 $ par million de tokens ; variante fast au double.
Pourquoi c’est un moment charnière
En avril, dans notre benchmark GPT-5.5 / Opus 4.7 / DeepSeek V4 / Kimi 2.6, le haut de tableau était encore une affaire OpenAI / Anthropic. Là, Grok 4.6 s’installe à 61 sur l’index AA, pile sur Sol Max. Ce n’est plus un outsider « fun sur X ». C’est un cran frontier que tu peux appeler depuis Cursor.
Le gap « OpenAI intouchable » n’est plus là. Pour un brief « qui est le plus intelligent ? », tu n’as plus de réponse unique. Tu as un peloton.
Verdict
Si tu es dev ou consultant et que tu vis dans Cursor, Grok 4.6 est le modèle à coller sur un bench interne cette semaine, surtout au tarif 2 / 6. Si tu chasses le dernier point d’index, Opus 5 (~63) et Fable 5 Max (62) restent devant. Si tu chasses le rapport intelligence / facture, 4.6 est dans le match.
Grok 4.6 n’est plus « le modèle X ». C’est un frontier à 61 qui coûte une fraction de Sol, avec une force revendiquée sur les trajectoires longues et un Terminal-Bench à 26 % qu’il faut regarder en face.
SpaceXAI a rattrapé Sol sur l’index, pas sur toutes les lignes. Tu le mets dans le routeur, tu ne vires pas tout le reste — la même logique qu’en avril, et le même réflexe qu’après ChatGPT 5.4.
Questions fréquentes
Quel cran prendre ?
Le 2 / 6 pour le volume et les agents longs. Fast (×2) si tu as besoin de latence. Tu ne le prends pas les yeux fermés pour du CLI dur : Terminal-Bench v3.0 est à 26 %.
Et face à GPT-5.6 Sol ?
Même 61 sur l’index AA. Sol coûte 5 / 30. Tu paies Sol si tu veux l’écosystème ChatGPT et le debug agentique OpenAI, pas parce qu’il « gagne l’index ». Opus 5 (~63) et Fable 5 Max (62) restent devant sur le composite.
Sources : https://x.ai/news/grok-4-6
Articles de la même catégorie
Benchmark août 2026 : Opus 5 vs Grok 4.6 vs GPT-5.6 Sol vs Kimi K3
Le peloton s’est resserré. Opus 5 gagne l’index, Grok 4.6 gagne le prix. Personne ne…
Claude Opus 5 : le modèle du quotidien, tout près du frontier
Anthropic pose Opus 5 en modèle de tous les jours : proche de Fable 5,…
Gemini 3.5 Pro : encore en preview, ce que Google a vraiment sorti
Honnête : 3.5 Pro est encore en preview partenaires. Ce que Google a vraiment sorti,…
GLM-5.3 : Z.ai pousse le post-training (et la cyber)
Z.ai ne réentraîne pas le socle. Il retravaille le post-training — et le terminal comme…