Austin Lyons, de Chipstrat: el foso de escala de rack de Nvidia es real, los temores sobre el financiamiento circular son exagerados y nadie ha construido un chip para LLMs todavía
Podcast Tech Surge, 22 de septiembre de 2026 — El analista de semiconductores de Creative Strategies analiza la era de la venta de sistemas y dónde podría surgir la próxima empresa de chips de un billón de dólares
Austin Lyons, analista de semiconductores en Creative Strategies y autor del boletín Chipstrat, expuso en el podcast Tech Surge una tesis que contradice una suposición común en la inversión en infraestructura de IA: que la industria avanza hacia la mercantilización. En cambio, Lyons sostiene que los compradores han optado decididamente por adquirir sistemas completos en lugar de chips discretos, un cambio que ha consolidado la posición competitiva de Nvidia, incluso mientras los patrones de gasto subyacentes se fragmentan de maneras que pocos inversionistas siguen de cerca.
Ningún chip ha sido construido específicamente para LLMs
La afirmación más llamativa de la conversación es también la más sencilla: a pesar de los billones de dólares que fluyen hacia la infraestructura de IA, ningún fabricante de semiconductores ha diseñado todavía un chip desde cero específicamente para la inferencia de modelos grandes de lenguaje (LLM). Las GPUs de Nvidia, explicó Lyons, "tienen antecedentes en gráficos y en la capacidad de realizar tareas en paralelo, y eso ha ido virando hacia la centralidad en la IA", pero la arquitectura sigue siendo un descendiente de propósito general de generaciones anteriores en lugar de un motor de LLM diseñado a propósito. Incluso el rack Helios de AMD y las combinaciones de GPU más LPU de Nvidia son, en sus palabras, chips que "se transformaron" para adaptarse a la carga de trabajo en lugar de chips concebidos para ella.
Ese vacío es precisamente donde ve oportunidades para los retadores. El chip Jalapeno de OpenAI, recientemente revelado y presentado en Hot Chips, es un claro ejemplo: en lugar de transferir caché KV compartida a través de un sistema, el diseño otorga a cada acelerador su propio segmento de HBM, eliminando la contención de memoria que afecta al silicio comercial. El enfoque de Tensor dyne, que sustituye las matemáticas logarítmicas por la multiplicación de matrices (convirtiendo multiplicaciones en sumas que se ejecutan más rápido en el silicio), es otro ejemplo de una apuesta arquitectónica que es poco probable que adopten los proveedores establecidos. La explicación de Lyons sobre el motivo es directa: los operadores establecidos se optimizan para la base de clientes más amplia posible y asumen un riesgo profesional que desincentiva los compromisos radicales en un producto de primera generación. Los proveedores comerciales, señaló, "puede que no tengan incentivos para asumir el riesgo" de opciones arquitectónicas no probadas cuando un diseño incremental y más seguro igual se venderá.
Por qué la ventaja de escala de rack de Nvidia es difícil de desbancar
Lyons atribuyó el cambio hacia la venta de sistemas a una realidad técnica directa: los modelos de frontera con dos billones de parámetros o más no caben en la memoria de una sola GPU, lo que obliga a dividir las cargas de trabajo entre decenas de chips que deben comunicarse sin interrupciones. La ventaja de Nvidia, argumentó, provino de haber sido la primera en hacer que esa complejidad fuera llave en mano, agrupando GPUs, CPUs, redes, energía y refrigeración en productos como el rack Grace Blackwell NVL72, junto con software como Dynamo, que orquesta todo el sistema. "Nvidia hizo un buen trabajo, francamente, al llegar primero y hacer que este sistema complejo fuera llave en mano", afirmó, señalando que los compradores de hoy se están optimizando para la velocidad de llegada al mercado y no para el costo más bajo, y apuntó a la rápida construcción de centros de datos de Elon Musk en xAI como el ejemplo más claro.
Esa dinámica, indicó Lyons, es precisamente la razón por la cual las startups de chips necesitan cada vez cientos de millones de dólares en financiamiento solo para alcanzar una prueba de concepto viable, en comparación con las rondas de varios millones de dólares que alguna vez fueron suficientes. Cerebras ilustra el costo de actuar en solitario: su motor a escala de oblea requirió inventar no solo un chip novedoso, sino toda una pila de soporte para la comunicación, la refrigeración y el suministro de energía, una carga que ralentiza considerablemente el tiempo de llegada al mercado.
La división de prefill-decode y el auge del silicio especializado
Lyons ofreció una de las explicaciones técnicas más claras disponibles sobre por qué las cargas de trabajo de inferencia se están desaggregando en etapas de prefill y decode. El prefill (la lectura paralelizable y la contextualización de un prompt completo) consume muchos recursos de cómputo pero poca memoria, lo que deja a la costosa HBM subutilizada. El decode (la generación secuencial token por token de una respuesta) es todo lo contrario: está limitado por la memoria y requiere poco cómputo. Esa discrepancia, abordada por primera vez por el propio software Dynamo de Nvidia, le abrió la puerta a startups de aceleradores como Groq y Cerebras, las cuales habían apostado anticipadamente por arquitecturas con alta cantidad de SRAM por razones ajenas a los LLMs, pero se encontraron en una posición perfecta una vez que surgió la demanda específica de decode.
Lyons espera que esta fragmentación eventualmente se consolide dentro de los proveedores individuales de silicio en lugar de seguir siendo un mosaico de múltiples proveedores, y estableció un paralelo con la forma en que la industria terminó estableciéndose en dos o tres proveedores dominantes de CPU y GPU. La adquisición de Groq por parte de Nvidia es un primer dato al respecto. Aun así, no descarta que nuevos participantes utilicen la misma desagregación para posicionarse en contra, e incluso es posible que las neoclubes absorban a startups de ASICs de IA para ofrecer silicio curado y específico para cargas de trabajo como un servicio.
Financiamiento circular: exagerado, pero comprensiblemente confuso
Al ser consultado directamente sobre la preocupación en torno a la circularidad —es decir, que las inversiones de capital de Nvidia en neoclubes financien compras de GPUs que generan ingresos que vuelven a Nvidia—, Lyons reconoció que su instinto inicial fue el escepticismo. "Definitivamente fui el tipo de persona que al instante pensó: de acuerdo, esto es diferente, esto se siente extraño", comentó. Sin embargo, su conclusión tras investigar a fondo es que el arreglo refleja un cuello de botella genuino en el costo de capital y no una demanda fabricada. La demanda de cómputo es real y, a su juicio, sigue estando subestimada incluso ahora debido al desplome en los costos de desarrollo de software impulsado por herramientas de codificación agéntica. La limitación radica en qué actores de la cadena tienen el balance general para financiar decenas de miles de millones de dólares en construcciones de centros de datos. Los bancos siguen mostrando reticencia a prestar directamente a operadores jóvenes de neoclubes, por lo que los acuerdos de compra de los hiperescaladores y los respaldos de Nvidia actúan como la mejora crediticia que destraba el financiamiento. "Eso es capitalismo", sentenció Lyons sin rodeos. "No lo van a hacer si no obtienen un beneficio". No discute que Nvidia se beneficie del acuerdo, sino que el mecanismo se asemeje a las burbujas de financiamiento de proveedores de la era puntocom.
Los inversionistas tradicionales infravaloran a las neoclubes
Lyons señaló que las tres principales neoclubes han creado aproximadamente $125.000 millones en valor de mercado en capital accionario público, más que la mayoría de las startups de chips juntas, y aun así los inversionistas se perdieron en gran medida la oportunidad. Su propia vacilación inicial provino de asumir que la concentración de clientes en los hiperescaladores volvía frágiles a estos negocios. En retrospectiva, considera que ese escepticismo estaba desubicado, dado que la concentración de clientes es endémica en toda la cadena de suministro de semiconductores, incluida la propia Nvidia. Atribuye la incapacidad de los hiperescaladores para capturar este valor por sí mismos a una mezcla de disciplina de capital, el dilema del innovador y sensibilidad a los márgenes, y destacó que algunos proveedores de la nube ven el alquiler de servidores físicos (*bare metal*) de bajo margen como un negocio mercantilizado al que prefieren no dar prioridad, mientras que las neoclubes tratan esos mismos ingresos como el núcleo de su modelo.
Cuatro condiciones para la próxima empresa de chips de un billón de dólares
El marco de trabajo de Lyons para identificar a la próxima empresa de semiconductores revelación se centra en cuatro criterios: la capacidad de ejecutar modelos de más de un billón de parámetros, la entrega de sistemas a escala de rack, superar a un operador establecido en una métrica de rendimiento definida, y conseguir que un laboratorio de modelos de frontera funcione como cliente ancla. Lo de la frontera es lo que más importa, según su perspectiva, porque ahí es donde "se acumulará un valor descomunal". Argumentó que los desarrolladores que construyen en la vanguardia pagarán una prima significativa por la velocidad, potencialmente miles de dólares al mes por una generación de tokens significativamente más rápida, mientras que las cargas de trabajo que utilicen modelos más pequeños y antiguos enfrentarán una competencia de precios mucho mayor y un suministro mercantilizado.
El indicador clave de rendimiento (*KPI*) relevante, añadió, no es la velocidad bruta, sino el rendimiento de tokens (*throughput*) con interactividad fija, normalizado por consumo de energía. Con las neoclubes limitadas por los megavatios y no solo por el capital, el cálculo se reduce a cuántos ingresos por rendimiento se pueden extraer de una asignación fija de energía, un enfoque que favorece a los chips optimizados para un punto específico de la curva de interactividad en lugar de la flexibilidad de propósito general.
La adopción de la IA empresarial está limitada por el talento, no por la infraestructura
Al ser consultado sobre si el despliegue empresarial local (*on-premises*) representa el mercado a largo plazo más grande —haciendo eco del patrón en el que la mayoría de las cargas de trabajo de la era de internet terminaron ejecutándose fuera de la nube—, Lyons coincidió en que la adopción corporativa será sustancial, pero enfatizó una limitación diferente a la disponibilidad de infraestructura. Las empresas quieren cada vez más mantener los datos propietarios y los procesos de ajuste fino (*fine-tuning*) internamente para construir una diferenciación defendible impulsada por la IA, afirmó, pero pocas emplean actualmente el talento necesario para ajustar modelos de manera interna. Comparó el momento con los primeros días de la adopción de software empresarial, cuando los expertos de la industria carecían de talento de ingeniería interno, y pronosticó un ciclo de desarrollo de talento similar, aunque reconoció, ante la pregunta del entrevistador, que el cuello de botella más inmediato podría ser la ausencia de herramientas que ayuden a las empresas a implementar IA generativa sin necesidad de contratar personal especializado en aprendizaje automático (*machine learning*).
El diseño de chips asistido por IA está reduciendo las barreras para el silicio personalizado
Lyons observa que las herramientas de diseño de chips aceleradas por IA están reduciendo significativamente tanto el costo como el cronograma para el silicio personalizado, lo que podría recortar un ciclo de desarrollo de tres años a uno solo y reducir los costos de la lista de materiales (*BOM*) lo suficiente como para hacer viables proyectos que antes no eran económicos. Citó la transición de Rivian hacia silicio personalizado para cargas de trabajo de conducción autónoma —donde las limitaciones de energía y los requisitos de latencia en tiempo real hacían que los chips comerciales no fueran adecuados— como el tipo de decisión que más empresas podrán justificar ahora. Tuvo cuidado de señalar que las herramientas son un arma de doble filo para las startups de chips, ya que los equipos de ingeniería experimentados en los proveedores comerciales de silicio establecidos están igualmente posicionados para explotar esas mismas ganancias de productividad y expandir sus propias líneas de producto con el fin de atender cargas de trabajo más especializadas.