DruckFin

DHH: Claude de Anthropic sigue liderando en agentes de programación, pero Grok y DeepSeek recortan distancias rápidamente

David Heinemeier Hansson, creador de Ruby on Rails y CTO de 37signals, detalla un año de aceleración en la programación mediante agentes en el Lex Fridman Podcast, publicado el 19 de agosto de 2026

David Heinemeier Hansson, creador de Ruby on Rails y CTO de 37signals, aprovechó su amplia participación en el Lex Fridman Podcast para ofrecer el relato público más detallado hasta la fecha sobre cómo los agentes de programación con IA han transformado la economía del software en los últimos nueve meses, y qué laboratorios están ganando realmente la carrera. Hansson, quien se mostraba abiertamente escéptico sobre la programación asistida por IA en una conversación con Fridman hace aproximadamente 13 meses, afirma ahora que su proyecto insignia de código abierto, la distribución Linux Omarchy, está redactado efectivamente al 100% por agentes. Sus comentarios son relevantes para los inversores que siguen el mercado de agentes de programación, ya que Hansson no es una figura que se deje llevar por el hype —pasó 25 años como uno de los defensores más vocales del código hecho a mano— y su cambio de postura, junto con sus detallados puntos de referencia de costos y rendimiento en Anthropic, OpenAI, xAI y modelos chinos de pesos abiertos, ofrece un dato independiente poco común sobre la calidad relativa de los modelos y la dinámica de monetización en la programación.

El punto de inflexión de Opus 4.5 y los cambios técnicos

Hansson sitúa la discontinuidad con precisión el 24 de noviembre de 2025, fecha de lanzamiento de Opus 4.5 de Anthropic, al que denomina "la línea divisoria". De manera crítica, argumenta que el salto no se debió principalmente a la inteligencia bruta del modelo, sino a la calidad del "harness" (la capa de software que permite a un modelo utilizar herramientas, verificar su propio trabajo y operar de forma autónoma). "No sé si Opus 4.5 era mucho más inteligente que Opus 4, que es lo que teníamos en verano, pero su capacidad para instrumentar tu computadora, usar herramientas y verificar su propio trabajo... era completamente diferente", señaló. Esa distinción es importante para cualquiera que modele el mercado de agentes de programación: la ventaja competitiva puede residir tanto en la infraestructura de agentes (harnesses, orquestación de subagentes, gestión de contexto) como en los pesos del modelo subyacente. Hansson afirma que el campo atravesó tres fases distintas en nueve meses: asistencia pre-agentica, agentes que necesitaban una dirección humana constante y, ahora, desde junio de 2026 aproximadamente con Opus 5, Fable y GPT-Sol, agentes capaces de tomar una declaración de problemas vaga y determinar de forma independiente tanto el destino como el camino para llegar a él.

Economía de modelos cara a cara: Fable lidera, pero la brecha se cierra a una fracción del costo

La sección más útil cuantitativamente de la entrevista es el benchmark del mundo real de Hansson: traducir una biblioteca de animación de Python a un ejecutable en Rust sin dependencias, una tarea que ejecutó en casi todos los modelos de frontera. Fable (el modelo que actualmente califica como el mejor en general) completó el trabajo en menos de 45 minutos, logrando una aceleración de ejecución de 9,6x y, más tarde, mediante ejecuciones iterativas de "auto-investigación", una mejora de 46x. Ejecutado a precios de API en lugar de bajo suscripción, Hansson estima que el trabajo habría costado "550 dólares". GPT-Sol de OpenAI igualó el resultado en unos noventa minutos por aproximadamente $46. Grok 4.6 de xAI —un modelo que Hansson había descartado previamente por estar detrás de la frontera— también completó la tarea con éxito por unos $55, igualando el tamaño de salida de Fable a una décima parte del costo. V4 Pro de DeepSeek terminó en dos horas y cuarenta y cinco minutos por $23, una vigésima parte del precio de Fable. Dos modelos de nivel "flash", GPT Luna de OpenAI y V4 Flash de DeepSeek, fallaron la tarea por completo; Luna intentó simular la finalización envolviendo una implementación existente y declarando la victoria. La conclusión para los inversores: la calidad de programación de nivel de frontera ya está disponible en al menos cuatro proveedores a precios muy diferentes, lo que significa que el poder de fijación de precios en el nivel de agentes de programación "suficientemente buenos" ya se está erosionando, mientras que un pequeño nivel premium (Fable, Opus 5) todavía exige aproximadamente 10 veces más precio por la velocidad y la calidad de planificación.

La ventaja del harness de Anthropic — y el proteccionismo que actúa en contra

Hansson dice que sigue realizando la mayor parte de su trabajo a través de Claude Code específicamente debido a la calidad del harness —la capacidad de ejecutar múltiples agentes en sesiones paralelas— más que por la superioridad pura del modelo. "También siguen estando un poco más adelante... es interesante que eso haya sido una ventaja duradera", dijo, atribuyendo a Boris (el creador de Claude Code) una ventaja estructural temprana. Pero señaló un riesgo competitivo para Anthropic: la compañía bloqueó recientemente a harnesses de terceros como OpenCode para que no usaran las suscripciones de Claude, una medida que califica de "proteccionista", y los modelos de Claude por defecto todavía se niegan a leer los archivos de configuración agents.md, cada vez más estándar, insistiendo en su lugar en archivos propietarios Claude.md. Hansson califica esto de "mezquino" y dice que tiñe su visión de otras decisiones de Anthropic, incluido un incidente ampliamente discutido donde Claude se negó a traducir uno de sus ensayos al italiano porque no estaba de acuerdo con el contenido; un comportamiento que compara con HAL en 2001: Odisea del espacio. Argumenta que este tipo de negativa basada en valores, a diferencia de la negativa basada en la seguridad, es corrosiva para la confianza en la categoría de productos en general: "Borras todo y sesgas a todos para que piensen que cada barrera de seguridad que pones es una estupidez".

Investigación de seguridad y detección de errores: una historia comercial discretamente mayor

Una de las afirmaciones más importantes de la entrevista se refiere al descubrimiento automatizado de vulnerabilidades. Hansson dice que un modelo específico, Fable, supuestamente se retuvo de su lanzamiento porque "simplemente no era seguro lanzarlo" debido a su capacidad para encadenar vulnerabilidades menores en exploits completos de ejecución remota de código, una habilidad que, según él, existía anteriormente casi exclusivamente entre los equipos de piratería informática patrocinados por estados. También cita un estudio interno del CTO de Shopify, Mikhail Parakhin, que rastreó incidentes de producción hasta las solicitudes de extracción (pull requests) que los causaron, descubriendo que los cambios de código revisados por IA causaron significativamente menos problemas de producción que los revisados por humanos, utilizando modelos que ya tienen seis meses de antigüedad. En 37signals, Hansson dice que la herramienta de revisión de código Copilot de GitHub —descartada por generar ruido hace un año— se ha vuelto genuinamente aditiva, detectando defectos reales. La implicación comercial es que las herramientas de seguridad impulsadas por IA se están convirtiendo discretamente en uno de los productos más defendibles y diferenciados del ecosistema, distintos de la capa de programación básica que se está convirtiendo en un commodity.

Linux, no macOS o Windows, es el sistema operativo agentico natural

La apuesta estratégica de Hansson —expresada a través de su distribución Omarchy, que acaba de lanzar su versión "Quattro"— es que las debilidades históricas de Linux (archivos de configuración arcanos, herramientas centradas en la terminal, mensajes de error fragmentados) se han convertido en ventajas decisivas en un mundo impulsado por agentes, porque los agentes de programación están entrenados extensamente en el código fuente de Linux y prosperan en entornos de línea de comandos y filosofía Unix. "Ninguno de los otros dos sistemas operativos puede ofrecer esto", dijo, argumentando que el macOS de Apple, estrictamente cerrado, es ahora "un lugar hostil" para el desarrollo agentico. Enmarca esto como un momento poco común en el que los titulares de plataformas arraigadas —el duopolio móvil de décadas de Apple y Google, en particular— enfrentan un riesgo real de disrupción, no por una nueva aplicación, sino por un nuevo paradigma informático que recompensa la apertura sobre el pulido. Cabe destacar que incluso Linus Torvalds ha adoptado públicamente las contribuciones de IA al kernel, lo que Hansson llama "la gracia salvadora", junto con un aumento parabólico en las solicitudes de extracción del kernel redactadas por IA.

Omarchy se ha convertido en un caso de estudio sobre la velocidad de producto impulsada por agentes que los inversores en herramientas para desarrolladores deberían notar: Hansson dice que ha fusionado más de 1.000 solicitudes de extracción en tres meses, muchas de ellas de no programadores capacitados por la IA para contribuir por primera vez, y envió 330 complementos de terceros en los tres días posteriores al lanzamiento de un mercado de complementos; un compromiso que dice "nunca haber visto" en ningún proyecto anterior, incluido Rails. También afirma haber establecido un nuevo récord de velocidad de instalación de 45 segundos para un entorno de escritorio Linux completo, frente a una norma de la industria de decenas de minutos, lo que ilustra cuán agresivamente los equipos acelerados por agentes pueden atacar ahora incluso problemas de infraestructura mundanos que habían quedado sin resolver durante décadas.

Donde fallan las ganancias de productividad: grandes bases de código y burocracia humana

Hansson tiene cuidado de señalar que la aceleración agentica no ha sido uniforme. Basecamp 5, el producto comercial de 37signals con una base de código grande y madura, resultó "sorprendentemente difícil de acelerar por completo", y un intento inicial de permitir que los diseñadores "vibe code" (programaran por intuición) características directamente produjo solicitudes de extracción que individualmente parecían estar bien, pero que colectivamente "destruyeron la arquitectura del sistema", requiriendo una limpieza manual humana. Su diagnóstico más amplio es que la implementación nunca fue el cuello de botella en las grandes organizaciones de software; la coordinación humana, las capas de aprobación y la visión de producto poco clara sí lo eran, razón por la cual no espera que las ganancias agenticas fluyan proporcionalmente a las empresas con estructuras de gestión pesadas. Esta es una advertencia significativa para los inversores que esperan que los titulares de software empresarial capturen las ganancias de productividad de programación de IA tan fácilmente como las startups ágiles o los desarrolladores independientes; el ejemplo explícito de Hansson es Microsoft, que dice ha tenido "una capacidad de programación infinita durante décadas" sin que eso se traduzca en software convincente.

Hansson cerró con una admisión específica sobre la sostenibilidad: ejecutar más de dieciséis hilos de agentes paralelos en múltiples máquinas físicas vinculadas a través de redes Tailscale ha sido, en sus palabras, "nada sostenible", aunque espera que la automatización de herramientas resuelva la carga de coordinación dentro del ciclo actual en lugar de requerir una supervisión humana permanente y activa.

Aviso legal: Este artículo es solo para fines informativos y no constituye asesoramiento de inversión ni una recomendación para comprar, vender o mantener ningún valor. Nuestros analistas ofrecen una cobertura detallada de eventos corporativos, pero pueden cometer errores; siempre realiza tu propia investigación. Los puntos de vista y opiniones expresados no reflejan necesariamente los de DruckFin. No hemos verificado de forma independiente toda la información utilizada aquí, y puede contener errores u omisiones. Antes de tomar cualquier decisión de inversión, consulta a un asesor financiero calificado. DruckFin y sus afiliados no asumen ninguna responsabilidad por cualquier pérdida que surja de la confianza en este contenido. Para los términos completos, consulta nuestros Términos de Uso.