DruckFin

Cerebras onthult CS4-systeem met 30x GPU-snelheidsvoordeel terwijl OpenAI bevestigt dat vraag naar rekenkracht "veruit uitloopt" op capaciteit

Productevenement na beursgang belicht architectuur van de volgende generatie, roadmap voor 2027 en groeiend klantenbestand met OpenAI, AMD, Arista en CrowdStrike

Cerebras Systems hield op 18 augustus 2026 in San Francisco zijn eerste grote publieke evenement sinds de beursgang eerder dit jaar, een productlancering onder de naam "Supernova". CEO Andrew Feldman maakte van de gelegenheid gebruik om het CS4-systeem en de rack-scale architectuur van de volgende generatie te onthullen. Daarnaast presenteerde hij een reeks partners en klanten, waaronder OpenAI, AMD, Arista Networks en CrowdStrike, die gezamenlijk de contouren schetsen van een breder ecosysteem voor gedesaggregeerde inferentie dat zich rond de wafer-scale chips van het bedrijf vormt.

CS4-architectuur: de belangrijkste technische onthulling

De meest relevante nieuwe informatie voor beleggers is de specificatie van het CS4-systeem. Volgens Cerebras levert dit 6x hogere prestaties op systeemniveau dan de huidige CS3-generatie, een 2x snellere generatie van tokens en tot 10x meer tokens per watt. Chief Technology Officer Sean Lie verklaarde dat het systeem is gebouwd rond een nieuwe chip genaamd de WSE-3 Turbo en het eerste Cerebras-systeem is dat drie wafers in één unit integreert. Dit resulteert in wat het bedrijf omschrijft als 43 petabytes per seconde aan geheugenbandbreedte per wafer. Lie claimde dat dit "2.000x meer geheugenbandbreedte is dan Rubin, de GPU van de volgende generatie van Nvidia". Een cijfer dat, indien accuraat, het structurele voordeel in geheugenbandbreedte onderstreept dat Cerebras naar eigen zeggen bezit in de decodeerfase van inferentie.

Het bedrijf introduceert tevens een nieuwe rack-scale architectuur genaamd Nexus, gebouwd rond modulaire voedingen en "pluggable backpacks" die elk een wafer-scale engine huisvesten. Cerebras stelt dat het modulaire ontwerp het aantal componenten met 50% vermindert, de productieautomatisering met 60% verhoogt en de implementatietijd in datacenters verkort van dagen naar uren. Een claim die direct inspeelt op de kapitaalintensiteit en implementatieproblemen die de uitrol van AI-infrastructuur op grote schaal hebben geteisterd. De CS4 is momenteel beschikbaar via early access en zal naar verwachting later dit kwartaal algemeen beschikbaar zijn.

Wellicht nog belangrijker voor langetermijnmodellen is de toezegging in de roadmap: Cerebras mikt op een verdubbeling van de ruwe prestaties per jaar, met een specifiek doel van 20x hogere doorvoer tegen 2027, naast een wafer-scale engine van de volgende generatie die dat jaar gepland staat voor het CS5-systeem. Dit is een meerjarige architecturale toezegging, geen eenmalige productupdate, en het geeft beleggers een concreet kader om de uitvoering aan te toetsen.

OpenAI-partnerschap schaalt op en vraag naar capaciteit is de echte graadmeter

Cerebras maakte bekend dat OpenAI vorige week "GPT-5.6 Sol Ultrafast mode" heeft aangekondigd, een nieuwe servicelaag die het meest intelligente model van OpenAI tot 14x sneller draait, exclusief beschikbaar op hardware van Cerebras. Thibault, Head of Core Products and Platforms bij OpenAI, verscheen op het podium en stelde onomwonden: "We zouden graag zien dat Ultrafast simpelweg de standaard wordt. Ik denk dat dit een voorproefje is van wat komen gaat." Een opmerking die Feldman direct onder de aandacht bracht van het publiek als zijnde opmerkelijk voor de beleggersgemeenschap.

Belangrijker dan de productlaag zelf was Thibaults commentaar op de capaciteitsbeperkingen binnen het gehele OpenAI-netwerk. Gevraagd naar hoe het bedrijf over schaalbaarheid denkt, zei hij: "Op een gegeven moment bereik je een punt waarop je het model op de GPU draait en het meer waarde oplevert dan de kosten om het op de GPU te draaien. En op dat moment wil je alle capaciteit ter wereld hebben om het simpelweg te draaien... dit is iets waar we constant over praten... de vraag loopt ver uit op de capaciteit die we over ons hele netwerk hebben. Ik denk niet dat er reden is om aan te nemen dat dit zal vertragen of veranderen." Dat is een direct, officieel datapunt over de vraagzijde van de AI-infrastructuur, afkomstig van een van de grootste afnemers van rekenkracht in de sector, en het versterkt de positieve vooruitzichten voor hardwareleveranciers in het algemeen, niet alleen voor Cerebras.

Thibault merkte ook op dat OpenAI inmiddels 15 miljoen wekelijkse gebruikers heeft die Codex en ChatGPT-agents gebruiken, waarbij binnen een week een bijgewerkt, hoger cijfer wordt verwacht. Hij waarschuwde echter dat de adoptie van agents nog steeds "een zeer klein fractie" is van de ongeveer 1 miljard wekelijkse gebruikers van ChatGPT, wat wijst op aanzienlijke ruimte voor groei in het volume van inferentie in de hele sector.

Gedesaggregeerde inferentie: het AMD-partnerschap formaliseert een nieuw architectuurpatroon

Cerebras gebruikte het evenement om een partnerschap met AMD toe te lichten, gebaseerd op wat het bedrijf 'gedesaggregeerde inferentie' noemt. Hierbij wordt de prefill-fase van inferentie (het verwerken van gebruikersinput, wat paralleliseerbaar is en weinig geheugenbandbreedte vereist) gesplitst naar de GPU's van AMD, specifiek het komende Helios-rack, terwijl de decodeerfase (sequentiële generatie van tokens, wat intensief is voor geheugenbandbreedte) wordt doorgestuurd naar de wafers van Cerebras. Feldman zei dat deze combinatie 10x snellere prestaties kan leveren dan GPU's alleen en 5x meer doorvoer dan Cerebras alleen. AMD CTO Mark Papermaster noemde het "een innovatie gedreven door noodzaak", wat een sectorbrede verschuiving in infrastructuuruitgaven weerspiegelt, van training-georiënteerde opbouw naar inferentie-geoptimaliseerde architectuur. De I/O-module van de CS4 is expliciet ontworpen als een "programmeerbare universele desaggregatie-interface" die gebruikmaakt van RoCE-gebaseerde netwerken, waardoor Cerebras zich positioneert als hardware-agnostisch in plaats van te proberen GPU's volledig te verdringen – een opvallend strategisch signaal gezien de omvang van de geïnstalleerde basis van Nvidia.

Opbouw van datacenters en de afhankelijkheid van netwerken

Feldman maakte bekend dat Cerebras 600 megawatt aan datacenter-capaciteit online heeft gebracht of onder contract heeft staan voor oplevering tegen het einde van volgend jaar. Dit verspreidt zich over Santa Clara, Toronto, Dallas, Minneapolis, Montreal, Oklahoma City, Alabama, Lyon en locaties in Noorwegen en Finland. Hij was openhartig dat dit "bij lange na niet genoeg is" en erkende dat de race om capaciteit een hardnekkige beperking blijft in plaats van een opgelost probleem.

Jayshree Ullal, CEO van Arista Networks, verscheen om de netwerklaag die deze clusters ondersteunt toe te lichten. Ze merkte op dat Arista gedifferentieerde verkeersklassen voor AI-workloads heeft gebouwd die losstaan van traditionele cloudnetwerken. Ze wees er bovendien op dat de adoptie van agentic AI door bedrijven, in tegenstelling tot implementaties door hyperscalers en neo-cloud providers, "nog nauwelijks op gang is gekomen", wat impliceert dat er een enorme onbenutte vraag in het verschiet ligt. Ze benadrukte ook netwerkveerkracht als het volgende grote knelpunt en stelde onomwonden: "De grootste uitdaging voor de toekomst zal zijn hoe je de beschikbaarheid van je rekenkracht behoudt" wanneer hardware faalt of kabels worden losgekoppeld. Een herinnering dat het schalen van betrouwbaarheid, en niet alleen ruwe snelheid, een onderscheidende factor zal zijn.

Klantvalidatie: Figma, Cognition, Armis en CrowdStrike kwantificeren de snelheidsthese

Naast de infrastructuurpartnerschappen presenteerde Cerebras daadwerkelijke implementatiegegevens. Cognition, maker van de Devin coding agent, maakte bekend dat zijn interne SWE-grep-model op Cerebras draait met maximaal 2.800 tokens per seconde, meer dan 10x sneller dan vergelijkbare large language models. Hun nieuwere SWE-1.7-model evenaart de kwaliteit van GPT-5.5 en Opus 4.8, terwijl het draait op bijna 1.000 tokens per seconde tegen aanzienlijk lagere kosten dan vergelijkbare modellen zoals Kimi K2.7 Code of GLM 5.2. Figma gaf details over een nieuw gelanceerde, door Cerebras aangedreven design-agent die direct in zijn multiplayer-canvas is ingebed. Het bedrijf stelt dat snelle inferentie de factor is die iteratief, niet-verifieerbaar creatief werk zoals design haalbaar maakt voor agents, op een manier die tragere inferentie niet kan ondersteunen.

Cerebras noemde ook Armis, een klant voor het scannen van codebeveiliging, die scans voltooit in ongeveer een derde van de tijd van benchmark-frontiermodellen, terwijl er meer kwetsbaarheden worden gevonden tegen lagere kosten. CrowdStrike, wiens VP of Engineering Keith Culley de beveiligingscase voor snelheid scherp verwoordde: met snellere inferentie kunnen beveiligingstools "5x tot 10x meer inspecties uitvoeren binnen hetzelfde acceptabele tijdsbestek", wat de drempel verlaagt en de adoptie van beveiligingscontroles in de breedte verhoogt. Hij wees op een industriële benchmark van 27 seconden als de snelste geregistreerde netwerkinbraaktijd door een aanvaller, en betoogde dat beslissingsmomenten in cybersecurity nu in enkele seconden worden gemeten – een use case waarbij inferentie-latentie een directe en kwantificeerbare financiële impact heeft, in plaats van slechts een UX-voordeel.

Alles bij elkaar fungeert het evenement minder als een onthulling van een enkel product en meer als een verdediging van een systeem-brede these: Cerebras zet erop in dat decodeer-workloads die gebonden zijn aan geheugenbandbreedte structureel in het voordeel blijven op wafer-scale silicium, dat gedesaggregeerde architecturen met GPU-partners (niet de vervanging van GPU's) de commercieel levensvatbare weg zijn, en dat een groeiende groep betalende klanten in de sectoren coding, design en security de bereidheid valideert om te betalen voor snelheid als een onderscheidend productkenmerk in plaats van als een benchmark-curiositeit.

Disclaimer: Dit artikel is uitsluitend bedoeld voor informatieve doeleinden en vormt geen beleggingsadvies of een aanbeveling om effecten te kopen, verkopen of aan te houden. Onze analisten bieden gedetailleerde verslaggeving van bedrijfsevents maar kunnen fouten maken, doe altijd je eigen onderzoek. De geuite opvattingen en meningen weerspiegelen niet noodzakelijkerwijs die van DruckFin. We hebben niet alle hierin gebruikte informatie onafhankelijk geverifieerd en deze kan fouten of weglatingen bevatten. Raadpleeg een gekwalificeerde financieel adviseur voordat je een beleggingsbeslissing neemt. DruckFin en haar dochterondernemingen wijzen elke aansprakelijkheid af voor eventuele verliezen die voortvloeien uit het vertrouwen op deze inhoud. Zie voor de volledige voorwaarden onze Gebruiksvoorwaarden.