GPT-5.6 Sol krijgt een nieuwe versnelling die tot 750 outputtokens per seconde haalt.
OpenAI draait de beperkte Ultrafast-preview daarvoor op chipsystemen van Cerebras.
Dat is meer dan een snellere API-optie. OpenAI laat hiermee zien dat de volgende
AI-strijd niet alleen draait om wie het beste model bouwt. Ook de partij die dat model het snelst laat reageren, krijgt meer macht.
GPT-5.6 Sol draait tot veertien keer sneller
OpenAI introduceerde
Ultrafast op 13 augustus als nieuwe servicelaag voor GPT-5.6 Sol.
Volgens het bedrijf draait Sol daarmee tot veertien keer sneller dan Standard processing en kan de uitvoersnelheid oplopen tot 750 tokens per seconde. De dienst start als beperkte preview voor een geselecteerde groep API-klanten.
OpenAI noemt incidentrespons, financiële research, beveiliging, klantenservice, voice, commerce en interactieve onderzoeksprocessen als eerste toepassingen.
Die voorbeelden hebben iets gemeen: wachten kost geld.
Een chatbot die drie seconden sneller antwoordt voelt prettiger. Een softwaresysteem dat tijdens één opdracht tientallen modelstappen uitvoert, kan veel harder profiteren.
Bij agents stapelt iedere vertraging zich op
Dat is waar snelheid economisch interessant wordt.
Een AI-agent kan informatie verzamelen, een tool starten, het resultaat lezen en daarna bepalen wat de volgende actie wordt. Iedere modelcall voegt vertraging toe.
OpenAI zegt zelf dat zijn teams Ultrafast onder meer gebruiken om logs en traces tijdens incidenten sneller te verwerken. Bij research worden bronnen doorzocht, data opgevraagd en resultaten opnieuw gebruikt voor de volgende stap.
Daar verandert 750 tokens per seconde van een leuk benchmarkcijfer in iets anders.
Hoe langer de keten van AI-beslissingen, hoe waardevoller iedere seconde wordt die uit één modelcall verdwijnt.
Een agent die twintig keer moet nadenken, voelt latency twintig keer.
Cerebras krijgt daarmee een serieuze OpenAI-rol
Minstens zo opvallend is waar GPT-5.6 Sol draait.
OpenAI zegt expliciet dat Cerebras Ultrafast aandrijft en noemt de introductie een volgende stap in de samenwerking tussen beide bedrijven. Cerebras ondersteunt Sol daarbij tot 750 outputtokens per seconde.
Dat betekent niet dat OpenAI zijn volledige rekencapaciteit naar Cerebras verhuist.
Ultrafast is voorlopig beperkt beschikbaar. OpenAI zegt de toegang uit te breiden wanneer meer capaciteit beschikbaar komt.
Maar voor Cerebras telt het signaal wel degelijk.
Een frontiermodel van OpenAI draait nu commercieel op zijn systemen voor klanten die specifiek willen betalen voor snelheid.
Cerebras-cloud groeit 281% in één jaar
De timing is sterk.
Cerebras publiceerde op 12 augustus zijn
cijfers over het tweede kwartaal. De GAAP-omzet uit cloud- en andere diensten kwam uit op $126 miljoen, 281% meer dan een jaar eerder.
De totale GAAP-omzet bedroeg $180,1 miljoen, een stijging van 74%. Cerebras meldde daarnaast meer dan 600 megawatt aan datacentercapaciteit die al beschikbaar is of onder contract staat voor levering tot eind 2027.
Ook de productie moet hard omhoog. Het bedrijf wil zijn productiecapaciteit in 2026 met meer dan een factor tien vergroten.
Daar staat een stevige rekening tegenover.
Cerebras draaide in het tweede kwartaal een GAAP-nettoverlies van ongeveer $450,5 miljoen. De groei is dus fors, maar goedkoop is de strijd om snelle AI-capaciteit bepaald niet.
Training en dagelijks gebruik worden verschillende gevechten
De AI-sector heeft jarenlang vooral gekeken naar de machines waarop nieuwe modellen worden getraind.
Inference wordt nu steeds belangrijker als aparte economische laag. Dat is het moment waarop een getraind model daadwerkelijk antwoorden genereert voor gebruikers en software.
Daar tellen andere eigenschappen zwaar.
Niet alleen hoeveel rekenwerk een systeem aankan, maar hoe snel een antwoord verschijnt en hoeveel verzoeken tegelijkertijd kunnen worden verwerkt.
Cerebras probeert daar zijn plek te pakken met zijn wafer-scale-ontwerp. Het bedrijf zegt daarbij geen HBM-geheugen, CoWoS-packaging of 3nm-productie nodig te hebben, drie onderdelen waarvoor volgens Cerebras beperkte capaciteit beschikbaar is.
Dat geeft het bedrijf een ander productieprofiel dan veel AI-systemen die sterk van zulke componenten afhankelijk zijn.
AMD en AWS staan al op de volgende planning
Cerebras probeert het model bovendien breder uit te rollen dan alleen OpenAI.
Het bedrijf zegt samen met AMD een gedisaggregeerde inference-opzet te hebben gebouwd die de throughput tot vijf keer moet verhogen. Die oplossing moet in het vierde kwartaal van 2026 in productie komen.
Voor AWS staat een vergelijkbare stap gepland.
Cerebras verwacht zijn gedisaggregeerde inference in het eerste kwartaal van 2027 naar Amazon Bedrock te brengen, opnieuw met een geclaimde throughputwinst tot vijf keer. Dat zijn nog toekomstplannen en dus geen gerealiseerde productieprestaties.
De richting is wel duidelijk.
Cerebras wil niet alleen chips verkopen. Het wil een plek veroveren in de laag waarop bedrijven hun AI-modellen iedere dag laten draaien.
Voor crypto telt vooral wat snellere agents straks kunnen doen
De OpenAI-aankondiging heeft zelf niets met crypto te maken.
De koppeling ontstaat bij autonome software.
Als agents steeds sneller informatie kunnen verwerken, tools kunnen starten en beslissingen kunnen nemen, worden ook transacties interessanter. Denk aan software die zelfstandig prijzen vergelijkt, diensten afneemt of later via
wallets waarde kan verplaatsen.
Stablecoins worden daarbij vaak genoemd als mogelijke betaalvorm voor software omdat digitale dollars programmeerbaar tussen systemen kunnen bewegen.
Dat betekent niet dat OpenAI met Ultrafast een crypto-betaalsysteem aankondigt. Dat doet het niet.
De relevante verschuiving zit ervoor: de intelligentielaag wordt sneller genoeg om veel meer acties achter elkaar uit te voeren.
De nieuwe AI-race wordt gemeten in werk per seconde
Daarmee verandert ook de definitie van een krachtig AI-systeem.
Een model kan bovenaan benchmarks staan en alsnog te langzaam zijn voor realtime beveiliging, voice of complexe agents. Een razendsnel model kan juist tekortschieten wanneer de kwaliteit onvoldoende is.
OpenAI probeert met Ultrafast beide bij elkaar te brengen: GPT-5.6 Sol zonder naar een kleiner model te hoeven terugschakelen voor snelheid.
Voor Cerebras is dat precies het gevecht dat het wil.
Niet aantonen dat het één indrukwekkende demo kan draaien, maar bewijzen dat bedrijven bereid zijn fors te betalen om krachtige modellen sneller te laten werken.
750 tokens per seconde is daarom niet alleen een snelheidsrecord om mee te zwaaien.
Het is een signaal dat inference zelf een nieuwe machtsmarkt wordt.