Modèles · 13 août 2026
Le 13 août 2026, OpenAI et Cerebras ont annoncé GPT-5.6 Sol Ultrafast: jusqu’à 750 jetons de sortie par seconde, soit, selon les chiffres avancés, environ 14 fois le rythme de l’offre Standard (environ 53 jetons par seconde). L’accès est en prévisualisation, sur invitation. Aucun tarif public Ultrafast ni date de disponibilité générale n’a été communiqué. La presse a cité, pour Standard et Fast, 5 dollars par million de jetons en entrée et 30 dollars par million en sortie. Cybernecs n’a pas accès à cette prévisualisation. Ce que nous pouvons dire à une TPE ou PME, c’est autre chose: la vitesse change le comportement des agents, et le coût API n’est pas un détail de DSI.
Pourquoi 750 jetons par seconde n’est pas un gadget de démo
Un agent « lent » impose un style: réponses courtes, peu d’allers-retours, l’utilisateur qui décroche. Un agent très rapide autorise des boucles: relire un ticket, interroger plusieurs outils, reformuler, vérifier une pièce, revenir vers l’humain en quelques secondes. Les usages cités autour de l’annonce (réponse à incident, support, finance, e-commerce) sont exactement ceux où la latence tue la valeur. Un support qui répond après trente secondes n’est pas un support. Un copilote d’incident qui arrive après le premier diagnostic humain arrive trop tard.
Cette vitesse a un prix de structure. À 30 dollars le million de jetons en sortie sur Standard/Fast, une boucle bavarde coûte cher. Ultrafast, s’il reste dans le même ordre de grandeur de tarif (ce que personne n’a publié), amplifiera le volume de jetons parce que les équipes oseront des chaînes plus longues. La facture ne suit pas la vitesse de façon linéaire: elle suit le nombre de boucles que la vitesse rend acceptables.
Ce que cela signifie pour un dirigeant français
Premier point: vous n’avez probablement pas Ultrafast aujourd’hui, et vous n’en avez pas besoin pour décider. L’annonce du 13 août confirme une tendance déjà visible: les fournisseurs cloud poussent la latence vers le bas, sur des infrastructures spécialisées (ici Cerebras). Le centre de gravité reste américain. L’AI Act, en vigueur sur la transparence depuis le 2 août 2026, n’y change rien. Transparence n’est pas souveraineté. Informer l’utilisateur qu’il parle à une IA ne dit pas où part le prompt.
Deuxième point: un agent plus rapide, branché sur vos mails, vos devis ou vos tickets, augmente la surface d’erreur par unité de temps. Hallucination tarifaire, envoi d’un document au mauvais destinataire, boucle qui exfiltre trop de contexte vers l’API. La cybersécurité de l’agent n’est pas un chapitre à part. Voir notre page cybersécurité de l’IA.
Troisième point: les métiers de terrain (chantier, atelier, accueil) gagnent à la latence courte, à condition que le système tienne sans dépendre d’une file d’attente cloud. C’est tout l’intérêt d’une exécution locale pour certains flux, et d’un cloud pour d’autres. Un agent IA pour le BTP qui doit répondre sur un parking d’entreprise, avec une connexion moyenne, n’a pas le même cahier des charges qu’un outil interne de siège.
Cinq actions, sans attendre une invitation OpenAI
- Mesurer le coût réel de vos agents actuels. Jetons entrée/sortie, appels outils, retries. Un tableau mensuel par usage (support, devis, RH). Sans ce compteur, Ultrafast ou pas, vous pilotez à l’aveugle.
- Plafonner les boucles. Nombre max d’appels outils, taille max de contexte envoyé, interdiction d’empiler des reformulations infinies. La vitesse future rendra ces plafonds encore plus nécessaires, pas moins.
- Séparer les flux sensibles. Données client, plans, paie, incident de sécurité: posez la question du lieu d’exécution. Une Synapse Box on-premise n’atteint pas 750 jetons/s sur un cluster Cerebras. Elle évite d’envoyer le dossier dans une API dont le tarif et la juridiction bougent sans vous.
- Garder l’humain sur les actes engageants. Prix, engagement contractuel, réponse à un incident public: validation humaine, même si le brouillon arrive en une seconde. L’article 50 vous impose déjà d’informer sur la nature de l’interlocuteur. La relecture, elle, est votre gouvernance.
- Ne pas lier votre métier à une preview. Invitation only, pas de prix Ultrafast public, pas de date de GA: ce n’est pas une brique d’architecture. C’est un signal de marché.
Souveraineté: l’alternative n’est pas « aussi rapide », c’est « assez maîtrisé »
Comparer une box française à une offre Ultrafast sur invitation est un faux débat si on le réduit au benchmark de débit. Le débat utile, pour une PME, est: quels flux ont besoin d’une latence extrême, quels flux ont besoin de rester dans vos murs, quels flux supportent un cloud UE ou US avec un contrat clair. Les solutions IA Cybernecs pour TPE et PME sont construites sur cette séparation, pas sur la course au jeton.
L’AI Act n’interdit pas GPT-5.6. Il impose, depuis le 2 août 2026, que l’utilisateur sache qu’il parle à une IA, que les contenus synthétiques soient marqués (avec un délai au 2 décembre 2026 pour le marquage machine des systèmes déjà sur le marché), et que les deepfakes professionnels soient étiquetés. Un agent ultra-rapide qui ne dit pas qui il est reste non conforme, fût-il impressionnant en démonstration.
Pour cadrer un choix d’architecture
Si vous hésitez entre API cloud, hébergement France et box locale, nous posons le comparatif sur vos flux réels (volume, données, horaires, réseau), pas sur une keynote. Écrivez-nous via la page contact. Nous n’avons pas Ultrafast. Nous avons l’habitude de diriger des agents qui doivent tenir lundi matin, pas seulement le jour de l’annonce.
Sources: Cerebras, TechCrunch, communications OpenAI, règlement sur l’intelligence artificielle (AI Act).