Ultrafast : pourquoi OpenAI mise sur l’inférence accélérée pour GPT-5.6 Sol
Une nouvelle couche de performance plutôt qu’un nouveau modèle
OpenAI expérimente un mode baptisé Ultrafast pour GPT-5.6 Sol, son modèle présenté comme le plus puissant de la gamme. D’après TechCrunch, ce mode vise à accélérer fortement l’exécution des tâches sans annoncer un modèle distinct. Cerebras le décrit de son côté comme un nouveau niveau de service, lancé d’abord dans l’API OpenAI et alimenté par son infrastructure.
L’idée est importante pour les équipes techniques : la valeur d’un modèle ne dépend pas uniquement de ses capacités de raisonnement ou de la qualité de ses réponses. Dans de nombreux usages professionnels, le temps nécessaire pour obtenir ces réponses compte tout autant. Une inférence plus rapide peut réduire l’attente dans une interface, accélérer le traitement d’un flux d’incidents ou permettre à un agent logiciel d’enchaîner davantage d’étapes.
Jusqu’à 750 tokens par seconde
Selon TechCrunch et Cerebras, Ultrafast peut fonctionner jusqu’à 14 fois la vitesse du traitement standard et produire jusqu’à 750 tokens de sortie par seconde. Un token correspond à une unité de texte générée par un grand modèle de langage : il peut s’agir d’un morceau de mot, d’un mot ou d’un signe de ponctuation. Ce débit ne doit donc pas être interprété directement comme 750 mots par seconde.
Le chiffre décrit surtout la vitesse de génération de la sortie. Il ne suffit pas, à lui seul, à déterminer le temps total d’une requête : celui-ci dépend aussi de la longueur du contexte, de la mise en file, du réseau, des outils appelés par l’agent et du temps de traitement avant la génération. Les faits disponibles ne précisent pas ces autres composantes ni les conditions exactes ayant permis d’atteindre le maximum annoncé.
Pour un développeur, la différence pratique est néanmoins claire : une réponse qui apparaît très rapidement peut rendre une interaction plus fluide et réduire la durée d’un traitement séquentiel. Pour des lots de tâches, le débit peut également devenir un facteur de coût et de capacité, à condition que les performances observées en production correspondent aux résultats de présentation.
Cerebras fournit l’architecture matérielle
Ultrafast repose sur le partenariat entre OpenAI et Cerebras. Selon Cerebras, GPT-5.6 Sol dans ce mode est exécuté sur son architecture Wafer-Scale Engine. L’entreprise explique que chaque puce de la taille d’un wafer contient 44 Go de SRAM. Cette mémoire intégrée est au cœur de son approche matérielle, qui cherche à limiter les déplacements de données pendant le calcul.
Cette information permet de comprendre pourquoi le lancement ne se résume pas à un simple réglage logiciel. Le débit dépend aussi de l’architecture qui exécute le modèle, de la mémoire disponible et de la manière dont les données circulent entre les composants. Pour les utilisateurs de l’API, cette complexité reste masquée, mais elle conditionne la capacité du fournisseur à proposer une vitesse élevée à grande échelle.
L’écosystème public de Cerebras comprend notamment des dépôts tels que modelzoo, gigaGPT, cerebras-cloud-sdk-python, cerebras-cloud-sdk-node et inference-examples. Son organisation GitHub liste le SDK Python sous licence Apache-2.0 et vscode-cerebras-chat sous licence MIT. Ces éléments témoignent d’un environnement de développement ouvert autour de certains outils, mais ils ne permettent pas à eux seuls d’évaluer les performances d’Ultrafast.
Des résultats de benchmark à lire avec prudence
Cerebras rapporte plusieurs résultats destinés à illustrer le gain obtenu. Dans son évaluation de Humanity’s Last Exam, GPT-5.6 Sol en mode Ultrafast aurait répondu aux 2 500 questions en 11 heures et 11 minutes. La même comparaison indique que Claude Fable 5 a eu besoin de 78 heures et 27 minutes pour parvenir aux mêmes conclusions.
Sur GDP-Val, présenté par Cerebras comme un benchmark de tâches de connaissance à valeur économique, l’entreprise annonce une accélération de bout en bout de 5,6 fois, sans dégradation de la qualité. Ces résultats sont des affirmations de Cerebras : ils donnent un ordre de grandeur dans les évaluations citées, mais ne constituent pas une garantie universelle pour tous les prompts, toutes les tailles de contexte ou tous les workflows.
La distinction entre débit de sortie et vitesse de bout en bout est ici essentielle. Le premier mesure principalement la rapidité de génération des tokens. Le second inclut davantage d’éléments du parcours d’une tâche. Une équipe qui envisage Ultrafast devra donc mesurer ses propres indicateurs : temps jusqu’au premier token, durée complète de la requête, taux d’erreur, coût par tâche et qualité après intégration des outils.
Quels usages peuvent réellement en bénéficier ?
OpenAI suggère, selon TechCrunch, plusieurs workflows d’entreprise : la réponse aux incidents, le service client et le support, l’analyse des marchés financiers ainsi que le commerce électronique. Dans la gestion d’incident, une génération rapide peut aider à synthétiser des événements ou à guider les premières étapes d’investigation. Dans le support, elle peut réduire le temps d’attente d’un agent ou d’un utilisateur.
Ces scénarios ne rendent pas la vitesse suffisante à elle seule. Une réponse très rapide mais incorrecte peut augmenter le travail de vérification. Les domaines financiers et les opérations critiques exigent notamment des contrôles adaptés, une traçabilité des décisions et une définition claire des actions autorisées. Les faits disponibles ne détaillent pas les mécanismes de sécurité, les limites de contexte, les quotas ou les tarifs d’Ultrafast ; ces paramètres seront déterminants pour une décision d’architecture.
Un marché qui commence à dissocier intelligence et rapidité
Ultrafast s’inscrit dans une évolution plus large : les fournisseurs commencent à proposer des modes d’inférence rapides en complément de leurs modèles habituels. La documentation de la plateforme Claude présente ainsi un Fast mode en préversion de recherche pour Claude Opus 5 et Claude Opus 4.8. Selon cette documentation, il utilise le même modèle avec une configuration d’inférence plus rapide et ne modifie ni l’intelligence ni les capacités annoncées ; il peut fournir jusqu’à 2,5 fois plus de tokens de sortie par seconde.
Ce mode Claude est disponible uniquement via l’API Claude, y compris Claude Managed Agents, et pas sur Amazon Bedrock, Google Cloud ou Microsoft Foundry. La documentation indique un tarif de 10 dollars par million de tokens d’entrée et de 50 dollars par million de tokens de sortie pour Claude Opus 5 et Claude Opus 4.8 en Fast mode. Cette comparaison ne permet pas de conclure qu’un mode est globalement meilleur que l’autre : les modèles, les plateformes, les benchmarks et les conditions d’accès diffèrent.
Pour Ultrafast, le point le plus concret reste la disponibilité. Le service est actuellement proposé en préversion limitée à un groupe sélectionné de clients, avec une extension de l’accès prévue au fil de l’augmentation des capacités, selon TechCrunch et Cerebras. Les équipes qui souhaitent l’évaluer devront donc vérifier leur éligibilité et tester le comportement réel du mode avant d’envisager une migration ou une généralisation.
À retenir
- Ultrafast est un niveau de service pour GPT-5.6 Sol, lancé en préversion dans l’API OpenAI et alimenté par Cerebras.
- OpenAI et Cerebras annoncent jusqu’à 750 tokens de sortie par seconde et une vitesse pouvant atteindre 14 fois le traitement standard.
- Les performances publiées par Cerebras incluent une accélération de bout en bout de 5,6 fois sur GDP-Val, mais elles doivent être vérifiées dans les workloads réels.
- L’accès est limité à un groupe de clients et doit s’étendre progressivement avec l’augmentation des capacités.
- Le Fast mode de Claude montre que l’accélération de l’inférence devient une offre distincte, avec ses propres conditions d’accès et de tarification.
Sources
- OpenAI introduces 'Ultrafast,' a new mode that makes GPT-5.6 Sol work at 14x the speed | TechCrunch — techcrunch.com, 13 August 2026
- Accelerating GPT-5.6 Sol Ultrafast with OpenAI — cerebras.ai
- Fast mode (research preview) — platform.claude.com
- Cerebras — github.com