Modèles
14 août 2026
Le 14 août 2026, Z.ai (Zhipu) a lancé GLM-5.3. Même base MoE 743B que GLM-5.2 : les gains viennent du post-training uniquement, pas d’un réentraînement du socle. Et les sauts sont brutaux — surtout sur le terminal et la cyber. Live sur l’API Z.ai, le GLM Coding Plan et ZCode. Des poids MIT sont attendus vers le 28 août après revue de sécurité : ce n’est pas garanti.
Dans cet article : ce que le post-training a vraiment bougé, les chiffres qu’on a, et ce que ça change pour un routeur. En résumé :
- Même 743B MoE que GLM-5.2. Post-training only : SFT, RL, recettes — pas un nouveau prétrain.
- Terminal-Bench 3.0 : 4,6 → 28,3. DeepSWE v1.1 : 46,2 → 66,9.
- Agents’ Last Exam CLI : 23,8 → 28,5. GDPval-AA v2 : 1769.
- CyberGym 84,5 % — devant Mythos 5 (83,8 %) et GPT-5.6 Sol (83,6 %).
- ExploitBench : 24,4 % → 54,4 %. Mythos 5 reste devant à 78 %.
- API live le 14 août. Prix API non publié. Poids MIT vers le 28 août, non garantis.
- Le modèle devient intéressant pour l’audit, pas pour « je le lâche sur un périmètre sans cadre ».
Qu’est-ce que GLM-5.3 change ?
Z.ai n’a pas reconstruit le modèle. Il a retravaillé ce qu’on met après : SFT, RL, recettes. Résultat, sur les benches agents / SWE / cyber, 5.3 ne joue plus dans la cour de 5.2.
On a passé six mois à croire qu’il fallait un nouveau prétrain pour bouger le frontier. GLM-5.3 dit l’inverse : même 743B, autre post-training, Terminal-Bench ×6, ExploitBench plus que doublé. Pour un chercheur ou un dev d’agents, c’est le papier de la semaine.
Hier, lui donner un vrai job CLI c’était perdre une après-midi. Aujourd’hui, tu peux lui coller un harness et mesurer. 28,3 n’est pas un score de roi — Grok 4.6 est à 26 % sur Terminal-Bench v3.0, même zone — mais le delta vs 5.2 est le vrai sujet. DeepSWE 66,9 le met à côté de Grok 4.6 (65,9 %) : pour un repo qui dure, 5.3 n’est plus un outsider cheap. GDPval-AA 1769, c’est du knowledge work, pas seulement du code.
Les variantes
Pas une famille tarifée. Un cran 5.3, appelable maintenant sur l’API Z.ai, le GLM Coding Plan et ZCode. Les poids MIT sont attendus vers le 28 août après revue de sécurité : ce n’est pas une promesse ferme. Le prix API n’est pas encore publié dans les chiffres qu’on retient ici. Tu ne construis pas une grille tarifaire là-dessus.
Disponibilité
Le 14 août 2026 : live sur l’API Z.ai, le GLM Coding Plan et ZCode. Poids MIT attendus vers le 28 août après revue de sécurité, pas une promesse ferme. Si ton plan c’est l’on-prem, tu attends la revue. Si ton plan c’est l’API, tu testes maintenant.
Pourquoi c’est un moment charnière
La ligne cyber n’est pas un détail. CyberGym 84,5 % passe devant Mythos 5 (83,8 %) et Sol (83,6 %). ExploitBench 54,4 % a rattrapé une partie du retard, pas tout : Mythos 5 reste devant à 78 %. Le modèle devient intéressant pour l’audit, pas pour « je le lâche sur un périmètre sans cadre ».
Tu ranges 5.3 à côté de Sol, Grok 4.6 et Opus 5 dans le routeur — la même thèse que notre benchmark d’avril, avec une lane cyber en plus. Côté Google, Gemini 3.1 Pro reste le flagship grand public.
Verdict
Si tu es dev d’agents ou consultant sécu et que tu as déjà un compte Z.ai / ZCode, 5.3 est le cran à bench tout de suite, surtout sur terminal et cyber. Si tu attends les poids MIT : vise ~28 août, et prévois le cas où la revue glisse. Si tu veux un prix public, il n’est pas là.
GLM-5.3 n’est pas un nouveau cerveau. C’est la preuve qu’un bon post-training peut faire passer un modèle de « absent du terminal » à « dans le match agents » — et le pousser très haut sur la cyber.
Questions fréquentes
Quel cran prendre ?
L’API maintenant, si tu as déjà Z.ai / ZCode. Les poids MIT seulement après la revue — et seulement si elle sort. Tu n’as pas de prix public : tu benches, tu ne construis pas une grille.
Et face à Mythos 5 ou Sol ?
Sur CyberGym, 5.3 passe devant Mythos 5 (83,8 %) et Sol (83,6 %). Sur ExploitBench, Mythos reste nettement devant (78 % vs 54,4 %). Tu l’ajoutes à la grille d’audit. Tu ne le vends pas comme « le modèle exploit ».
Sources : lancement Z.ai du 14 août 2026, MarkTechPost.
Articles de la même catégorie
Benchmark août 2026 : Opus 5 vs Grok 4.6 vs GPT-5.6 Sol vs Kimi K3
Le peloton s’est resserré. Opus 5 gagne l’index, Grok 4.6 gagne le prix. Personne ne…
Claude Opus 5 : le modèle du quotidien, tout près du frontier
Anthropic pose Opus 5 en modèle de tous les jours : proche de Fable 5,…
Gemini 3.5 Pro : encore en preview, ce que Google a vraiment sorti
Honnête : 3.5 Pro est encore en preview partenaires. Ce que Google a vraiment sorti,…
Kimi K3 : Moonshot mise sur le coding long-horizon
Moonshot sort un open-weight taillé pour les repos qui durent. Derrière Grok 4.6 et Sol…