Chipstrats Austin Lyons: 'De rack-scale-greep van Nvidia is reëel, de vrees voor kringloopfinanciering is overdreven en niemand heeft nog een chip voor LLM's gebouwd'
Tech Surge Podcast, 22 september 2026 — Halfgeleideranalist van Creative Strategies bespreekt het tijdperk van de systeemverkoop en waar het volgende triljoen-dollar-chipbedrijf kan opstaan
Austin Lyons, halfgeleideranalist bij Creative Strategies en auteur van de Chipstrat-nieuwsbrief, schetste in de Tech Surge-podcast een visie die ingaat tegen een hardnekkige aanname binnen AI-infrastructuurbeleggingen: dat de sector afstevent op commoditisering. Lyons stelt daarentegen dat kopers resoluut zijn overgeschakeld op de aanschaf van complete systemen in plaats van losse chips. Deze omslag heeft de concurrentiepositie van Nvidia versterkt,zelfs al fragmenteren de onderliggende uitgavenstromen op een manier die weinigen nauwlettend volgen.
Er is nog nooit een chip speciaal voor LLM's gebouwd
De meest opvallende bewering uit het gesprek is tevens de eenvoudigste: ondanks de biljoenen dollars die naar AI-infrastructuur stromen, heeft geen enkele siliciumleverancier tot op heden vanaf een onbeschreven blad een chip ontworpen die specifiek is toegespitst op de inferentie van large language models. De GPU's van Nvidia, zo legde Lyons uit, 'vinden hun oorsprong in de grafische hoek en het parallel verwerken van taken, en dat is verschoven naar AI-gericht', maar de architectuur blijft in de kern een general-purpose afstammeling van eerdere generaties in plaats van een speciaal ontworpen LLM-motor. Zelfs de Helios-rack van AMD en de combinaties van GPU's en LPU's van Nvidia zijn, in zijn woorden, chips die zijn 'gemorand' naar de workload in plaats van ervoor ontworpen.
Die leemte biedt volgens hem juist kansen voor uitdagers. De recent onthulde Jalapeno-chip van OpenAI, gepresenteerd op Hot Chips, is hier een treffend voorbeeld van: in plaats van gedeelde KV-caches door een systeem te sluizen, krijgt in dit ontwerp elke accelerator zijn eigen HBM-sectie. Hiermee wordt de geheugenconflicten vermeden die standaard silicium teisteren. De aanpak van Tensor dyne, waarbij logaritmische wiskunde in de plaats komt van matrixvermenigvuldiging en vermenigvuldigingen worden omgezet in optellingen die sneller draaien op silicium, is een ander voorbeeld van een architectonische gok die gevestigde leveranciers waarschijnlijk niet snel zullen wagen. Lyons verklaart dit op nuchtere toon: gevestigde partijen optimaliseren voor de breedste klantenkring en dragen carrière-risico's met zich mee die radicale compromissen bij een product van de eerste generatie ontmoedigen. Commerciële leveranciers, zo stelt hij, 'worden er wellicht niet toe aangezet om het risico te nemen' op onbewezen architectonische keuzes zolang een veiliger, incrementeel ontwerp zich laat verkopen.
Waarom het rack-scale-voordeel van Nvidia lastig te doorbreken is
Lyons herleidde de verschuiving naar systeemverkoop tot een nuchtere technische realiteit: grensverleggende modellen met twee biljoen of meer parameters passen niet in het geheugen van een enkelvoudige GPU. Dit dwingt ertoe om workloads op te knippen over tientallen chips die naadloos met elkaar moeten communiceren. Het voordeel van Nvidia kwam voort uit het feit dat zij als eerste deze complexiteit kant-en-klaar wisten aan te bieden, waarbij GPU's, CPU's, netwerkapparatuur, voeding en koeling werden gebundeld in producten zoals de Grace Blackwell NVL72-rack, ondersteund door software zoals Dynamo die het hele systeem aanstuurt. 'Nvidia heeft het eerlijk gezegd goed aangepakt door er als eerste bij te zijn en dit ingewikkelde systeem kant-en-klaar te leveren', aldus Lyons. Hij merkt op dat kopers vandaag de dag optimaliseren op market-speed in plaats van de laagste kosten, en wijst op de snelle uitrol van datacenters door Elon Musk bij xAI als het meest sprekende voorbeeld.
Diezelfde dynamiek is volgens Lyons precies de reden waarom chip-start-ups tegenwoordig honderden miljoenen dollars aan financiering nodig hebben om uberhaupt een levensvatbaar proof-of-concept te bereiken, vergeleken met de financieringsrondes van enkele miljoenen die vroeger volstonden. Cerebras illustreert de kosten van een solotraject: voor de wafer-scale-processor moest niet alleen een vernieuwende chip worden bedacht, maar ook een compleet ondersteunend ecosysteem voor communicatie, koeling en stroomvoorziening. Dat brengt een last met zich mee die de time-to-market aanzienlijk vertraagt.
De prefill-decode-splitsing en de opkomst van gespecialiseerd silicium
Lyons gaf een van de helderste technische uiteenzettingen over de vraag waarom inferentieworkloads worden opgesplitst in prefill- en decode-fasen. Prefill — het parallel te verwerken proces waarin een complete prompt wordt ingelezen en in de juiste context geplaatst — vergt veel rekenkracht maar weinig geheugen, waardoor dure HBM onderbenut blijft. Decode, de sequentiële generatie van een antwoord token voor token, werkt precies andersom: geheugenintensief en licht qua rekentaken. Die discrepantie, die aanvankelijk werd aangepakt door Nvidia's eigen Dynamo-software, opende de deur voor accelerator-start-ups zoals Groq en Cerebras. Beide speelden vroegtijdig in op architecturen die zwaar leunen op SRAM, om redenen die losstonden van LLM's, maar bevonden zich plotseling in een ideale uitgangspositie toen de vraag specifiek naar decode toenam.
Lyons verwacht dat deze fragmentatie uiteindelijk zal consolideren binnen individuele siliciumleveranciers in plaats de markt te verdelen in een lappendeken van meerdere leveranciers. Hij trekt hierbij een parallel met hoe de industrie zich destijds heeft geschikt naar twee of drie dominante CPU- en GPU-leveranciers. De overname van Groq door Nvidia is hiervan een vroegtijdig signaal. Desondanks sluit hij niet uit dat nieuwkomers dezelfde opsplitsing gebruiken om zich te herpositioneren, en suggereert hij zelfs dat neoclouds AI-ASIC-start-ups zouden kunnen inlijven om doelgerichte, workload-specifieke chips als dienst aan te bieden.
Kringloopfinanciering: overdreven, maar begrijpelijk verwarrend
Gevraagd naar de bezorgdheid over de kringloopfinanciering — het fenomeen waarbij Nvidia's aandeleninvesteringen in neoclouds worden gebruikt voor de aanschaf van GPU's, wat op zijn beurt inkomsten genereert die terugvloeien naar Nvidia — erkende Lyons dat hij aanvankelijk sceptisch was. 'Ik behoorde absoluut tot de categorie die dacht: wacht eens even, dit is anders, dit voelt vreemd aan', aldus Lyons. Zijn conclusie na grondig onderzoek is echter dat deze constructie een reëel kapitaalkostenbottleneck weerspiegelt in plaats van kunstmatige vraag. De vraag naar rekenkracht is echt en, naar zijn mening, zelfs nu nog onderschat gezien de kelderende kosten voor softwareontwikkeling dankzij agentic coding-tools. Het werkelijke knelpunt is welke spelers in de keten over de balans beschikken om de financiering van tientallen miljarden dollars voor datacenters te dragen. Banken aarzelen nog altijd om rechtstreeks te lenen aan jonge neocloud-exploitanten, waardoor afnameovereenkomsten met hyperscalers en garanties van Nvidia dienen als de kredietversterking die de financiering vlot trekt. 'Dat is nu eenmaal kapitalisme', stelt Lyons nuchter vast. 'Ze doen het niet als ze er zelf niet van profiteren.' Hij ontkent niet dat Nvidia baat heeft bij deze constructie, maar verwerpt de vergelijking met de zeepbel rond de leveranciersfinanciering uit de internetzeepbel-tijd.
Neoclouds worden onderschat door traditionele beleggers
Lyons wees erop dat de top drie van neoclouds gezamenlijk ongeveer $125 miljard aan beurswaarde heeft gecreëerd, meer dan de meeste chip-start-ups bij elkaar, en dat beleggers deze boot grotendeels hebben gemist. Zijn eigen aarzeling in het begin kwam voort uit de aanname dat de concentratie van hyperscaler-klanten deze bedrijven kwetsbaar maakte. Achteraf gezien beschouwt hij dat scepticisme als misplaatst, aangezien klantconcentratie nu eenmaal endemisch is in de toeleveringsketen van halfgeleiders, inclusief voor Nvidia zelf. Hij schrijft het onvermogen van hyperscalers om deze waarde zelf te verzilveren toe aan een combinatie van kapitaaldiscipline, het dilemma van de vernieuwer en margegevoeligheid. Zo merken sommige cloudproviders de verkoop van bare metal GPU's met lage marges aan als een gekommoditiseerd product waar ze liever geen prioriteit aan geven, terwijl neoclouds deze omzet beschouwen als de kern van hun bedrijfsmodel.
Vier voorwaarden voor het volgende triljoen-dollar-chipbedrijf
Lyons' kader voor het identificeren van de volgende doorbrekende chiponderneming berust op vier criteria: het vermogen om modellen met een biljoen of meer parameters te draaien, rack-scale-systeemlevering, het overtreffen van een gevestigde partij op een vastgelegde prestatiemetriek, en het binnenhalen van een toonaangevend modellaboratorium als ankerklant. Dat laatste is volgens hem cruciaal, omdat zich daar 'buitensporige waarde zal concentreren'. Ontwikkelaars die bouwen aan de absolute grens zullen een aanzienlijke premie betalen voor snelheid, mogelijk duizenden dollars per maand voor aanzienlijk snellere tokengeneratie, terwijl workloads die gebruikmaken van kleinere, oudere modellen te maken krijgen met heftige prijsconcurrentie en een gekommoditiseerd aanbod, aldus Lyons.
De relevante KPI is volgens hem niet de ruwe snelheid, maar de tokendoorvoer bij een vaste interactiviteit, genormaliseerd naar stroomverbruik. Aangezien neoclouds worden beperkt door megawattverbruik in plaats van alleen kapitaal, draait de berekening erom hoeveel inkomsten genererende doorvoer kan worden geperst uit een vast stroombudget. Deze invalshoek bevoordeelt chips die zijn geoptimaliseerd voor een specifiek punt op de interactiviteitscurve in plaats van algemene flexibiliteit.
De adoptie van enterprise-AI wordt geremd door talent, niet door infrastructuur
Gevraagd of on-premises implementaties bij ondernemingen de grotere langetermijnmarkt vertegenwoordigen — in lijn met het patroon waarin de meeste workloads uit het internettijdperk uiteindelijk buiten de cloud werden gedraaid — beaamde Lyons dat de bedrijfsmatige adoptie aanzienlijk zal zijn, maar legde hij de nadruk op een ander knelpunt dan de beschikbaarheid van infrastructuur. Bedrijven willen hun eigen data en fijnafstemmingsprocessen vaker binnenshuis houden om een verdedigbaar, op AI gedreven onderscheidend vermogen op te bouwen, zo stelt hij, maar weinigen beschikken momenteel over het benodigde talent om modellen intern te verfijnen. Hij vergeleek dit moment met de begindagen van enterprise software, waarin domeinexperts geen eigen engineeringtalent in huis hadden, en voorspelde een vergelijkbare cyclus voor de opbouw van talent. Wel gaf hij toe, aangemoedigd door zijn interviewer, dat het meer nabije knelpunt weleens kan liggen in het ontbreken van tooling waarmee ondernemingen generatieve AI kunnen inzetten zonder gespecialiseerd machinelearningpersoneel aan te hoeven nemen.
Door AI ondersteund chipontwerp verlaagt de drempel voor maatwerksilicium
Lyons ziet dat door AI versnelde chipontwerptools zowel de kosten als de doorlooptijd van maatwerksilicium aanzienlijk verkorten. Een ontwikkelingscyclus van drie jaar kan mogelijk worden teruggebracht tot één jaar, terwijl de materiaalkosten dusdanig dalen dat voorheen onrendabele projecten levensvatbaar worden. Hij haalde de overstap van Rivian naar maatwerksilicium voor autonoom rijden aan, waar strenge stroomlimieten en real-time latentie-eisen off-the-shelf chips ongeschikt maakten, als het type beslissing dat meer bedrijven nu zullen kunnen verantwoorden. Tegelijkertijd waarschuwde hij dat deze tools voor chip-start-ups een tweesnijdend zwaard zijn: ervaren engineeringteams bij gevestigde siliciumleveranciers bevinden zich immers in dezelfde gunstige positie om deze productiviteitswinsten aan te wenden voor het uitbreiden van hun eigen productlijnen en het bedienen van specifiekere markten.