DruckFin

Chipstrats Austin Lyons: Nvidias Rack-Scale-Burggraben ist real, die Sorgen um Kreislauffinanzierung sind übertrieben, und noch hat niemand einen Chip für LLMs gebaut

Tech Surge Podcast, 22. September 2026 – Halbleiteranalyst von Creative Strategies analysiert die Ära des Systemvertriebs und die Aussichten für das nächste Billionen-Dollar-Chipunternehmen

Austin Lyons, Halbleiteranalyst bei Creative Strategies und Autor des Newsletters Chipstrat, hat im Tech Surge Podcast eine These dargelegt, die einer gängigen Annahme von KI-Infrastrukturinvestoren widerspricht: dass sich die Branche auf eine Verkommodifizierung zubewegt. Stattdessen argumentiert Lyons, Käufer seien entschlossen dazu übergegangen, komplette Systeme statt einzelner Chips zu erwerben. Dieser Wandel hat Nvidias Wettbewerbsposition gestärkt, während sich die Ausgabenmuster unter der Oberfläche auf eine Weise fragmentieren, die nur wenige Investoren genau verfolgen.

Noch wurde kein Chip speziell für LLMs entwickelt

Die markanteste These des Gesprächs ist zugleich die einfachste: Trotz der Billionen von Dollar, die in die KI-Infrastruktur fließen, hat noch kein Halbleiterhersteller einen Chip auf dem Reißbrett entworfen, der speziell für die Inferenz von Large Language Models (LLMs) ausgelegt ist. Nvidias GPUs, so erklärte Lyons, „haben eine Historie im Grafikbereich und darin, Dinge parallel zu verarbeiten, und das hat sich in Richtung KI verschoben“. Die Architektur sei jedoch nach wie vor ein universelles Derivat vorheriger Generationen und keine zweckgebundene LLM-Engine. Selbst das Helios-Rack von AMD und Nvidias Kombinationen aus GPU und LPU seien, seinen Worten nach, Chips, die sich dem Workload „angepasst“ anstatt für diesen konzipiert worden zu sein.

Genau in dieser Lücke sieht er Chancen für Herausforderer. Der von OpenAI kürzlich auf den Hot-Chips-Konferenzen präsentierte Jalapeno-Chip ist hierfür ein Beispiel: Anstatt einen gemeinsamen KV-Cache im System zu verteilen, verleiht das Design jedem Beschleuniger eine eigene HBM-Einheit und eliminiert so Speicherengpässe, die handelsübliche Halbleiter plagen. Der Ansatz von Tensor Dyne, Logarithmus-Mathematik anstelle von Matrixmultiplikation zu verwenden und Multiplikationen in Additionen umzuwandeln, die auf Silizium schneller laufen, ist ein weiteres Beispiel für eine architektonische Wette, die etablierte Anbieter wahrscheinlich nicht eingehen werden. Lyons erklärt dies ganz pragmatisch: Etablierte Akteure optimieren für die breite Kundenbasis und tragen Karriererisiken, die radikale Kompromisse bei einem Produkt der ersten Generation verhindern. Unabhängige Anbieter, so sagte er, „werden möglicherweise nicht dazu motiviert sein, das Risiko“ unbewiesener architektonischer Entscheidungen einzugehen, solange sich ein sicheres, inkrementelles Design weiterhin verkaufen lässt.

Warum Nvidias Rack-Scale-Vorteil schwer zu erschüttern ist

Lyons führte den Wandel hin zum Systemvertrieb auf eine einfache technische Realität zurück: Frontier-Modelle mit zwei Billionen oder mehr Parametern passen nicht in den Speicher einer einzelnen GPU, weshalb Workloads auf Dutzende von Chips aufgeteilt werden müssen, die nahtlos miteinander kommunizieren müssen. Nvidias Vorsprung, so argumentierte er, rühre daher, dass man als Erster diese Komplexität schlüsselfertig gemacht habe – durch die Bündelung von GPUs, CPUs, Netzwerken, Stromversorgung und Kühlung in Produkten wie dem Rack Grace Blackwell NVL72 sowie Software wie Dynamo, die das gesamte System orchestriert. „Nvidia hat ehrlicherweise einen guten Job gemacht, indem sie als Erste da waren und dieses komplizierte System schlüsselfertig gemacht haben“, sagte er und verwies darauf, dass Käufer heute auf Marktreife statt auf niedrigste Kosten optimieren. Als klarstes Beispiel nannte er Elon Musks rasanten Rechenzentrumsausbau bei xAI.

Genau diese Dynamik ist laut Lyons der Grund, warum Chiptstartups zunehmend Hunderte Millionen Dollar an Finanzierung benötigen, um überhaupt einen tragfähigen Machbarkeitsnachweis (Proof of Concept) zu erreichen – verglichen mit den Runden über wenige Millionen Dollar, die früher ausreichten. Cerebras veranschaulicht die Kosten des Alleingangs: Die Wafer-Scale-Engine erforderte nicht nur die Erfindung eines neuartigen Chips, sondern eines gesamten Unterstützungssacks für Kommunikation, Kühlung und Stromversorgung – eine Last, die die Time-to-Market erheblich verlangsamt.

Die Aufteilung von Prefill und Decode und der Aufstieg spezialisierter Halbleiter

Lyons lieferte eine der klarsten technischen Erklärungen dafür, warum Inferenz-Workloads in Prefill- und Decode-Phasen aufgeteilt werden. Prefill – der parallelisierbare Prozess des Lesens und Kontextualisierens eines gesamten Prompts – ist rechenintensiv, aber speicherarm, wodurch teures HBM (High Bandwidth Memory) unterausgelastet bleibt. Decode, die sequenzielle tokenbasierte Generierung einer Antwort, ist das genau Gegenteil: speichergebunden und rechenleicht. Diese Diskrepanz, die ursprünglich durch Nvidias eigene Dynamo-Software adressiert wurde, öffnete die Tür für Beschleuniger-Startups wie Groq und Cerebras. Beide hatten frühzeitig auf SRAM-lastige Architekturen gesetzt, aus Gründen, die nichts mit LLMs zu tun hatten, sich nun aber perfekt positioniert sahen, als die Nachfrage nach Decode-spezifischen Lösungen einsetzte.

Lyons geht davon aus, dass sich diese Fragmentierung letztlich wieder bei einzelnen Halbleiteranbietern konsolidieren wird, anstatt ein Multi-Vendor-Flickenteppich zu bleiben. Er zieht Parallelen dazu, wie sich die Branche letztlich auf zwei oder drei dominante CPU- und GPU-Lieferanten geeinigt hat. Nvidias Übernahme von Groq ist hierfür ein erster Datenpunkt. Dennoch schließt er nicht aus, dass neue Marktteilnehmer dieselbe Desaggregation für Gegenpositionierungen nutzen – möglicherweise sogar Neoclouds, die KI-ASIC-Startups absorbieren, um maßgeschneiderte, worklobspezifische Halbleiter as a Service anzubieten.

Kreislauffinanzierung: Übertrieben, aber verständlicherweise verwirrend

Auf die Bedenken hinsichtlich der Zirkularität angesprochen – dass Nvidias Eigenkapitalinvestitionen in Neoclouds GPU-Käufe finanzieren, deren Erlöse wieder zu Nvidia zurückfließen –, räumte Lyons ein, dass seine erste Intuition Skepsis war. „Ich war definitiv der Typ Mensch, der sofort dachte: Okay, das ist anders, das fühlt sich seltsam an“, sagte er. Seine Schlussfolgerung nach eingehender Prüfung ist jedoch, dass diese Vereinbarung eher einen echten Kapitalkosten-Engpass als künstliche Nachfrage widerspiegelt. Die Nachfrage nach Rechenleistung ist real und seiner Ansicht nach selbst jetzt noch untertrieben, angesichts des Einbruchs der Softwareentwicklungskosten durch Agenten-basierte Coding-Tools. Der Engpass liegt darin, welche Akteure in der Kette über die Bilanzstärke verfügen, um den Rechenzentrumsausbau im zweistelligen Milliardenbereich zu finanzieren. Banken zögern nach wie vor, junge Neocloud-Betreiber direkt zu finanzieren; daher dienen Abnahmeverträge der Hyperscaler und Nvidia-Absicherungen als Kreditverbesserung, die die Finanzierung ermöglicht. „Das ist Kapitalismus“, sagte Lyons direkt. „Sie tun es nicht, wenn sie nicht davon profitieren.“ Er bestreitet nicht, dass Nvidia von diesem Arrangement profitiert, sondern lediglich, dass der Mechanismus den Verkäuferfinanzierungsblasen der Dotcom-Ära ähnelt.

Neoclouds werden von traditionellen Investoren unterschätzt

Lyons wies darauf hin, dass die drei führenden Neoclouds einen börsennotierten Eigenkapitalwert von rund 125 Milliarden US-Dollar geschaffen haben – mehr als die meisten Chiptstartups zusammen –, Investoren diese Gelegenheit jedoch größtenteils verpasst haben. Seine eigene anfängliche Zurückhaltung rührte daher, dass er annahm, die Kundenkonzentration bei Hyperscalern mache diese Geschäfte anfällig. Im Nachhinein hält er diese Skepsis für verfehlt, da eine Kundenkonzentration in der gesamten Halbleiterlieferkette endemisch ist, auch für Nvidia selbst. Er führt das Versagen der Hyperscaler, diesen Wert selbst abzuschöpfen, auf eine Mischung aus Kapitaldisziplin, dem Innovator’s Dilemma und Margensensitivität zurück. Einige Cloud-Anbieter betrachten margenschwache Bare-Metal-GPU-Vermietung als verkommodifiziertes Geschäft, das sie nur ungern priorisieren, während Neoclouds denselben Umsatz als Kern ihres Modells betrachten.

Vier Voraussetzungen für das nächste Billionen-Dollar-Chipunternehmen

Lyons Framework zur Identifizierung des nächsten Durchbruchs-Halbleiterunternehmens stützt sich auf vier Kriterien: die Fähigkeit, Modelle mit einer Billion oder mehr Parametern auszuführen, die Lieferung von Systemen im Rack-Maßstab, das Schlagen eines etablierten Anbieters bei einer definierten Leistungsmetrik sowie das Gewinnen eines Frontier-Modelllabors als Ankerkunden. Das Frontier-Segment ist ihm zufolge am wichtigsten, da dort „übergroßer Wert entstehen wird“. Er argumentierte, dass Entwickler, die an der vordersten Front entwickeln, eine erhebliche Prämie für Geschwindigkeit zahlen werden – möglicherweise Tausende von Dollar pro Monat für eine deutlich schnellere Token-Generierung –, während Workloads mit kleineren, älteren Modellen einem weitaus größeren Preiswettbewerb und einem verkommodifizierten Angebot ausgesetzt sind.

Die relevante Kennzahl (KPI) sei nicht die rohe Geschwindigkeit, sondern der Token-Durchsatz bei fester Interaktivität, normalisiert auf den Stromverbrauch, fügte er hinzu. Da Neoclouds eher durch Megawatt als allein durch Kapital eingeschränkt sind, lautet das Kalkül, wie viel umsatzgenerierenden Durchsatz man aus einer festen Stromzuteilung herausholen kann. Diese Rahmung begünstigt Chips, die für einen spezifischen Punkt der Interaktivitätskurve optimiert sind, anstatt auf universelle Flexibilität zu setzen.

Die Einführung von Unternehmens-KI wird durch Talente, nicht durch Infrastruktur gebremst

Auf die Frage, ob die On-Premises-Bereitstellung in Unternehmen den größeren langfristigen Markt darstellt – in Anlehnung an das Muster, bei dem die meisten Workloads der Internet-Ära letztlich außerhalb der Cloud liefen –, stimmte Lyons zu, dass die Unternehmensadoption substanziell sein wird. Er betonte jedoch einen anderen Engpass als die Verfügbarkeit der Infrastruktur. Unternehmen wollen zunehmend proprietäre Daten und Feinabstimmungsprozesse im Haus behalten, um eine verteidigbare, KI-gesteuerte Differenzierung aufzubauen, so Lyons. Allerdings beschäftigen derzeit nur wenige die Talente, die erforderlich sind, um Modelle intern feinabzustimmen. Er verglich diesen Moment mit den Anfängen der Unternehmenssoftware-Adoption, als Fachexperten über keine internen Ingenieurtalente verfügten, und prognostizierte einen ähnlichen Talentaufbauzyklus – räumte auf Nachfrage seines Interviewers jedoch ein, dass der unmittelbare Engpass möglicherweise im Fehlen von Tools liegt, die Unternehmen den Einsatz von generativer KI ermöglichen, ohne dass hierfür spezialisiertes Personal für maschinelles Lernen eingestellt werden muss.

KI-gestütztes Chipdesign senkt die Hürden für kundenspezifische Halbleiter

Lyons sieht in KI-beschleunigten Chipdesign-Tools ein Mittel, das sowohl die Kosten als auch den Zeitplan für kundenspezifische Halbleiter drastisch verkürzt. So lässt sich ein dreijähriger Entwicklungszyklus potenziell auf ein Jahr komprimieren und die Stücklistenkosten (Bill of Materials) so weit senken, dass zuvor unrentable Projekte realisierbar werden. Er verwies auf Rivians Umstellung auf kundenspezifische Halbleiter für autonome Fahr-Workloads – bei denen Strombeschränkungen und Echtzeit-Latenzanforderungen Standardchips ungeeignet machten –, als die Art von Entscheidung, die nun mehr Unternehmen rechtfertigen können. Er wies jedoch sorgfältig darauf hin, dass diese Tools für Chip-Startups ein zweischneidiges Schwert sind, da erfahrene Ingenieursteams bei etablierten Standardchipherstellern gleichermaßen in der Lage sind, dieselben Produktivitätssteigerungen zu nutzen, um ihre eigenen Produktlinien zu erweitern und spezialisiertere Workloads zu bedienen.

Haftungsausschluss: Dieser Artikel dient nur zu Informationszwecken und stellt keine Anlageberatung oder eine Empfehlung zum Kauf, Verkauf oder Halten von Wertpapieren dar. Unsere Analysten bieten eine detaillierte Abdeckung von Unternehmensereignissen, können jedoch Fehler machen; führen Sie immer Ihre eigene Due-Diligence-Prüfung durch. Die geäußerten Ansichten und Meinungen spiegeln nicht unbedingt die von DruckFin wider. Wir haben nicht alle hier verwendeten Informationen unabhängig verifiziert, und sie können Fehler oder Auslassungen enthalten. Konsultieren Sie einen qualifizierten Finanzberater, bevor Sie eine Anlageentscheidung treffen. DruckFin und seine verbundenen Unternehmen lehnen jede Haftung für Verluste ab, die durch das Vertrauen auf diese Inhalte entstehen. Die vollständigen Bedingungen finden Sie in unseren Nutzungsbedingungen.