Cerebras presenta el sistema CS4 con una ventaja de velocidad 30x sobre las GPU, mientras OpenAI confirma que la demanda de cómputo "supera ampliamente" la capacidad
El evento de producto tras la salida a bolsa detalla la arquitectura de próxima generación, la hoja de ruta para 2027 y una creciente lista de clientes que incluye a OpenAI, AMD, Arista y CrowdStrike
Cerebras Systems celebró su primer gran evento público desde su salida a bolsa a principios de este año, un lanzamiento de producto denominado "Supernova" en San Francisco el 18 de agosto de 2026. El CEO Andrew Feldman aprovechó el escenario para presentar el sistema CS4 de próxima generación y la arquitectura a escala de rack de la compañía, mientras desfilaba una serie de socios y clientes, incluidos OpenAI, AMD, Arista Networks y CrowdStrike, que en conjunto esbozan un ecosistema de inferencia desagregada más amplio que se está formando en torno a los chips de escala de oblea (wafer-scale) de la empresa.
Arquitectura CS4: el anuncio técnico principal
La información nueva más relevante para los inversores es la especificación del sistema CS4, que según Cerebras ofrece un rendimiento a nivel de sistema 6 veces superior al de su generación actual CS3, una generación de tokens 2 veces más rápida y hasta 10 veces más tokens por vatio. El director de tecnología, Sean Lie, señaló que el sistema está construido en torno a un nuevo chip llamado WSE-3 Turbo y es el primer sistema de Cerebras que integra tres obleas en una sola unidad, lo que genera lo que la empresa describe como 43 petabytes por segundo de ancho de banda de memoria por oblea. Lie afirmó que esto es "2.000 veces más ancho de banda de memoria que Rubin, la GPU de próxima generación de Nvidia", una cifra que, de ser precisa, subraya la ventaja estructural en ancho de banda de memoria que Cerebras cree poseer en la fase de decodificación de la inferencia.
La compañía también está introduciendo una nueva arquitectura a escala de rack llamada Nexus, construida alrededor de fuentes de alimentación modulares y "mochilas conectables" (pluggable backpacks), cada una de las cuales alberga un motor de escala de oblea. Cerebras afirma que el diseño modular reduce el número de componentes en un 50%, aumenta la automatización de la fabricación en un 60% y reduce los tiempos de implementación en centros de datos de días a horas, una afirmación dirigida directamente a abordar la intensidad de capital y la fricción de implementación que han obstaculizado las construcciones de infraestructura de IA a gran escala. El CS4 se encuentra actualmente en acceso anticipado y se espera que esté disponible de forma general más adelante este trimestre.
Quizás más importante para fines de modelado a largo plazo es el compromiso de la hoja de ruta: Cerebras proyecta duplicar el rendimiento bruto cada año, con un objetivo específico de 20 veces mayor rendimiento para 2027, junto con un motor de escala de oblea de próxima generación programado para el sistema CS5 ese mismo año. Se trata de un compromiso de arquitectura plurianual, no de una actualización de producto única, y ofrece a los inversores una cadencia concreta con la cual medir la ejecución.
La asociación con OpenAI crece y los comentarios sobre la demanda son la verdadera clave
Cerebras reveló que OpenAI anunció la semana pasada el "modo GPT-5.6 Sol Ultrafast", un nuevo nivel de servicio que ejecuta el modelo más inteligente de OpenAI a una velocidad hasta 14 veces superior a la estándar, disponible exclusivamente en hardware de Cerebras. Thibault, jefe de productos y plataformas centrales de OpenAI, apareció en el escenario y declaró claramente que "nos encantaría que Ultrafast fuera simplemente el estándar. Creo que es un vistazo de lo que está por venir", un comentario que Feldman destacó directamente a la audiencia como digno de mención para la comunidad inversora.
Más significativo que el nivel de producto en sí fue el comentario de Thibault sobre las limitaciones de capacidad en toda la flota de OpenAI. Al preguntársele sobre cómo piensa la empresa acerca de la escala, dijo que "en algún momento, llegas a un punto en el que ejecutas el modelo en la GPU y proporciona más valor que el costo de ejecutarlo en la GPU. Y en ese punto, quieres tener toda la capacidad del mundo para simplemente ejecutarlo... esto es algo de lo que hablamos todo el tiempo... es como si la demanda superara ampliamente la capacidad que tenemos en toda nuestra flota. No creo que haya razones para creer que eso se ralentizará o cambiará". Ese es un punto de datos directo y oficial sobre el lado de la demanda en la construcción de infraestructura de IA, proveniente de uno de los mayores compradores de cómputo de la industria, y refuerza la tesis alcista para los proveedores de hardware en general, no solo para Cerebras.
Thibault también señaló que OpenAI tiene ahora 15 millones de usuarios semanales ejecutando agentes de Codex y ChatGPT, y se espera una cifra actualizada y más alta dentro de la semana, aunque advirtió que la adopción de agentes sigue siendo "una fracción muy pequeña" de los aproximadamente 1.000 millones de usuarios semanales de ChatGPT, lo que sugiere un margen significativo para el crecimiento del volumen de inferencia en toda la industria.
Inferencia desagregada: la asociación con AMD formaliza un nuevo patrón de arquitectura
Cerebras utilizó el evento para detallar una asociación con AMD construida en torno a lo que denomina inferencia desagregada, dividiendo la etapa de prellenado (prefill) de la inferencia (procesamiento de la entrada del usuario, que es paralelizable y requiere poco ancho de banda de memoria) en las GPU de AMD, específicamente el próximo rack Helios, mientras se dirige la etapa de decodificación (generación secuencial de tokens, que requiere un gran ancho de banda de memoria) a las obleas de Cerebras. Feldman dijo que esta combinación puede ofrecer un rendimiento 10 veces más rápido que las GPU por sí solas y 5 veces más rendimiento que Cerebras por sí solo. El CTO de AMD, Mark Papermaster, lo llamó "una innovación impulsada por la necesidad", lo que refleja un cambio en toda la industria en el gasto de infraestructura, pasando de construcciones dominadas por el entrenamiento hacia una arquitectura optimizada para la inferencia. El módulo de E/S del CS4 fue diseñado explícitamente como una "interfaz de desagregación universal programable" utilizando redes basadas en RoCE, posicionando a Cerebras como independiente del hardware en lugar de intentar desplazar a las GPU por completo, una señal estratégica notable dado el tamaño de la base instalada de Nvidia.
Construcción de centros de datos y la dependencia de las redes
Feldman reveló que Cerebras ha puesto en línea o tiene bajo contrato 600 megavatios de capacidad de centros de datos para su entrega a finales del próximo año, abarcando Santa Clara, Toronto, Dallas, Minneapolis, Montreal, Oklahoma City, Alabama, Lyon y sitios en Noruega y Finlandia. Fue sincero al decir que esto "no es ni de lejos suficiente", reconociendo que la carrera por la capacidad sigue siendo una limitación persistente en lugar de un problema resuelto.
La CEO de Arista Networks, Jayshree Ullal, apareció para detallar la capa de red que sustenta estos clústeres, señalando que Arista ha creado clases de tráfico diferenciadas para cargas de trabajo de IA distintas de las redes de nube tradicionales, y señalando que la adopción empresarial de la IA de agentes, distinta de la implementación de hiperescaladores y neo-nubes, "apenas ha comenzado", lo que implica un gran grupo de demanda no capturada por delante. También enfatizó la resiliencia de la red como el próximo gran cuello de botella, afirmando claramente que "el mayor desafío en el futuro será cómo mantener la disponibilidad de su cómputo" cuando el hardware falla o se desconectan cables, un recordatorio de que la escalabilidad de la fiabilidad, y no solo la velocidad bruta, será un diferenciador.
Validación de clientes: Figma, Cognition, Armis y CrowdStrike cuantifican la tesis de velocidad
Más allá de las asociaciones de infraestructura, Cerebras presentó datos de implementación reales. Cognition, creador del agente de codificación Devin, reveló que su modelo interno SWE-grep se ejecuta en Cerebras a hasta 2.800 tokens por segundo, más de 10 veces más rápido que modelos de lenguaje grandes comparables, y que su nuevo modelo SWE-1.7 iguala a GPT-5.5 y Opus 4.8 en calidad mientras se ejecuta a cerca de 1.000 tokens por segundo a un costo significativamente menor que modelos comparables como Kimi K2.7 Code o GLM 5.2. Figma detalló un agente de diseño recién lanzado, impulsado por Cerebras e integrado directamente en su lienzo multijugador, argumentando que la inferencia rápida es lo que hace que el trabajo creativo iterativo y no verificable, como el diseño, sea manejable para los agentes de una manera que una inferencia más lenta no puede soportar.
Cerebras también citó a Armis, un cliente de escaneo de seguridad de código, que completa los escaneos en aproximadamente un tercio del tiempo de los modelos de referencia de frontera mientras encuentra más vulnerabilidades a menor costo, y a CrowdStrike, cuyo vicepresidente de ingeniería, Keith Culley, enmarcó el caso de seguridad para la velocidad de manera contundente: con una inferencia más rápida, las herramientas de seguridad pueden realizar "de 5 a 10 veces más inspecciones dentro del mismo período de tiempo aceptable", lo que reduce la fricción y aumenta la adopción de controles de seguridad en general. Señaló un punto de referencia de la industria de 27 segundos como el tiempo de ruptura de red más rápido registrado por un adversario, argumentando que las ventanas de decisión en ciberseguridad ahora se miden en segundos de un solo dígito, un caso de uso donde la latencia de inferencia tiene un impacto directo y cuantificable en dólares, en lugar de ser solo un beneficio de experiencia de usuario.
En conjunto, el evento funciona menos como una revelación de un solo producto y más como una defensa de tesis a nivel de sistema: Cerebras apuesta a que las cargas de trabajo de decodificación limitadas por el ancho de banda de memoria siguen teniendo una ventaja estructural en el silicio de escala de oblea, que las arquitecturas desagregadas con socios de GPU (no el reemplazo de GPU) son el camino comercialmente viable, y que un conjunto cada vez mayor de clientes de pago en los sectores de codificación, diseño y seguridad valida la disposición a pagar por la velocidad como un atributo de producto distinto en lugar de una curiosidad de referencia.