DruckFin

Transcripción de Physical Intelligence: Sergey Levine sobre el escalado en robótica humanoide, generalización y desafíos del ecosistema

2 de septiembre de 2026 | Sergey Levine en conversación sobre el estado de la IA física y la robótica humanoide

Introducción

Sergey Levine: Para mí, eso es algo alucinante porque el modelo base no fue entrenado con ningún dato humano en absoluto.

Anfitrión: Este es Sergey Levine, uno de los investigadores en robótica más destacados del mundo, y le pregunté todo sobre el estado actual de la robótica humanoide. ¿Cuáles son las capacidades emergentes más asombrosas que has visto hasta ahora?

Sergey Levine: No creo que nadie que haya visto esa evaluación haya pensado que el robot iba a hacer esto.

Anfitrión: Tengo algunas preguntas por aquí sobre China. A veces es imposible evitarlo. Si la robótica humanoide no tuviera éxito en un plazo de pocos años, ¿cuál crees que sería la razón más probable del fracaso? Aquí tienen el episodio completo.

Dónde estamos hoy en el escalado de la robótica

Anfitrión: Los modelos de lenguaje grande han generado un impacto y una inversión sin precedentes en ese ámbito. La IA física y los robots humanoides podrían tener un impacto potencialmente aún mayor. Quería preguntarte hoy en qué punto nos encontramos con la robótica humanoide y cómo prevés que esta tecnología llegue realmente al mundo.

Sergey Levine: Supongo que con el aprendizaje automático, lo que hemos aprendido en los últimos años, o más bien en la última década, es que funciona cuando se aplica a escala. Esto resulta muy obvio ahora, pero no siempre lo fue. Hay una salvedad: hay que escalar lo correcto. Al principio, cuando la gente empezó a trabajar en modelos para el lenguaje, por ejemplo, el diseño dominante eran las LSTM. Algunos recordarán qué son. Eran más o menos aceptables. Eran mucho mejores que lo que vino antes, pero en realidad no escalaban tan bien. Lo importante de los transformers no fue que fueran particularmente elegantes a nivel matemático ni nada por el estilo; simplemente escalaban mejor. Eran más fáciles de entrenar con cantidades muy grandes de datos y muchos parámetros.

La tecnología avanza por fases. Primero, descubres qué puedes escalar, básicamente cuál es la tecnología escalable, y luego viertes un esfuerzo a escala industrial, añadiendo una gran cantidad de datos y aumentando el tamaño del modelo. Es entonces cuando ocurre la magia. Cuando realizamos un desarrollo tecnológico más fundamental, la clave consiste en entender cuáles son esas palancas escalables. Defines el diseño, calculas más o menos las mezclas, y eso por sí solo logra algo bastante interesante, pero no es lo que realmente cambia el mundo. Es cuando empiezas a accionar esa palanca cuando las cosas cambian de verdad.

Con los LLM, cuando salieron los primeros modelos GPT con GPT-2, hacía algunas cosas, pero era algo así como un truco de magia. Podías lograr que sintetizara una historia sobre unicornios en Perú o algo similar, y era un inglés coherente, pero no era algo que fuera a resolver un sinfín de problemas del mundo real. Las personas que trabajaron en esto reconocieron de algún modo que ocurre algo mágico porque, a medida que añades más datos y haces que el modelo sea más grande, todo esto se vuelve más coherente y eficaz. Podían ver que, si hacíamos mucho más de eso, se volvería mucho más potente.

Volviendo a tu pregunta, lo que diría sobre la robótica es que no se encuentra en la etapa de GPT-4 a GPT-5, donde hay un esfuerzo a escala industrial para hacer el modelo más grande y obtener una mayor capacidad. Está en esa fase en la que estamos estableciendo las tecnologías fundamentales. Debido a esto, lo que uno debería esperar ver en este momento no es necesariamente que cada mes el modelo sea más grande y potente según alguna curva de crecimiento predecible. Lo que ocurre es que las propiedades de escalado están evolucionando a medida que desarrollamos las tecnologías adecuadas.

Para aterrizar esto en algo más cercano a la realidad, estoy muy contento con las demostraciones que hacemos aquí en Physical Intelligence, y creo que muchos de los resultados que otros están presentando son realmente geniales. Pero para ponerlos en contexto, no debemos esperar que estas sean las cosas que realmente ilustran el poder de la escala. Debemos esperar que sirvan para desarrollar las tecnologías fundamentales que luego se escalarán. El punto en el que creo que estamos ahora es que estamos colocando todas esas piezas del puzle en su sitio, y creo que falta muy poco. Muchas piezas del puzle están encajando. Lo que hace tan difícil pronosticar hacia dónde irá la tecnología es que todavía no está en esa etapa de escalado predecible. Está en la fase en la que estamos descubriendo las piezas del puzle, lo cual me parece sumamente emocionante, pero significa que también es muy difícil prever cuáles serán los coeficientes de eso.

Capacidades más sorprendentes y errores semánticos

Anfitrión: ¿Cuáles son las capacidades emergentes más asombrosas que has visto hasta ahora?

Sergey Levine: Eso es lo más divertido y, sin duda, hemos visto mucho más de eso a medida que avanzamos. Al principio eran pequeñas cosas, pero tenían un toque mágico porque en la robótica, básicamente antes de 2024, esto nunca sucedía. Esas pequeñas cosas que ocurren... tal vez hace unos dos años, veíamos cosas como el entrenamiento de nuestra política para doblar la ropa, donde el robot saca camisas individuales del cesto e intenta doblarlas. Un recuerdo muy vívido que tengo de finales de 2024 es ver una de las evaluaciones en la que saca dos camisas al mismo tiempo. Me quedé mirando aquello pensando que todo había terminado y que era imposible que pudiera resolverlo. Luego pone las dos camisas sobre la mesa, las desenreda, vuelve a meter una y empieza a doblar la otra. En retrospectiva, puedes hacer una labor detectivesca y descubrir de qué parte de los datos de entrenamiento sacó eso, pero ese fue uno de esos momentos en los que creo que nadie que estuviera viendo esa evaluación pensaba que el robot iba a hacer algo así. Está mostrando el sentido común que uno espera de las personas.

En realidad, lo que me parece más interesante últimamente son algunos de los errores. Una de las características más notables de los LLM era que, una vez que alcanzaban la madurez suficiente, incluso los errores tenían cierto sentido, en el sentido de que no eran errores descabellados en los que el sistema simplemente arrojaba caracteres aleatorios todo el tiempo, sino fallos semánticamente coherentes. El año pasado tuvimos una evaluación para el modelo π0 en la que el robot estaba limpiando una cocina, y se le ordenó guardar todos los utensilios, como algunas cucharas y espátulas. El robot intenta abrir el cajón donde cree que van los cubiertos y no logra abrirlo. Así que se desplaza hacia un lado, abre el horno que está justo al lado y empieza a meter las cosas dentro del horno. Uno puede imaginar que, si le pides a un niño que limpie y guarde las cosas, podría decidir hacer eso porque es un recipiente, se pueden guardar cosas ahí y nadie las ve.

Otro experimento que realizamos consistía en lavar todos los platos. El robot cogía los platos, los lavaba con una esponja y los colocaba en el escurridor. Esto era un experimento sobre la memoria, ya que debe llevar un registro de todo lo que está haciendo. Cuenta con una especie de memoria provisional en la que anota que tenía 3 platos, que limpió el de color gris y que limpió el verde. Luego se le cae uno de los platos al suelo, desplaza su base para que no se pueda ver y concluye que ya ha limpiado el plato gris y que ha terminado. Obviamente, estas no son las cosas que queremos ver, pero resulta interesante que algunos de los errores se parezcan casi a los que asociarías con un niño intentando realizar la tarea. Ahora solo necesita madurar.

Lecciones de la conducción autónoma

Anfitrión: Mencionaste los avances que se están produciendo en toda la industria. Sé que hay mucha gente construyendo robots humanoides. Está Figure, está Tesla y hay muchos otros competidores. Tienes la experiencia de saber qué es difícil y qué no. Cuando miras a la competencia, ¿ha habido algún avance o logro que te parezca realmente admirable e impresioinante?

Sergey Levine: De hecho, creo que una de las cosas más inspiradoras para mí en la industria es ver el despegue que han tenido los sistemas de conducción autónoma. Una de las críticas que a veces se les hace a los investigadores de robótica es que esto es como la fusión nuclear, la tecnología del futuro que siempre está en el futuro. Eso es lo que la gente decía también de la conducción autónoma. Ahora estamos en San Francisco, puedes salir a la calle, tomar un Waymo y te llevará a tu destino sin que haya ningún conductor sentado al volante.

Sin entrar demasiado en detalles técnicos, lo que realmente inspira de esto es precisamente el ejemplo de que se puede lograr que una de estas tecnologías del futuro se materialice. Creo que no es casualidad que esté aterrizando ahora, a mediados de la década de 2020, porque muchas de las piezas del puzle del aprendizaje automático a gran escala están alcanzando el nivel en el que podemos combinarlas con sistemas físicos reales. Por supuesto, existen muchas diferencias entre la conducción y la manipulación robótica, pero la demostración de que realmente podemos implementar tecnologías basadas en el aprendizaje en el mundo físico real es muy inspiradora.

Impacto de la entrada de los laboratorios de IA de frontera en la robótica

Anfitrión: Si OpenAI o Anthropic empezaran a invertir con más fuerza en la robótica, ¿cómo crees que afectaría a la industria? ¿Crees que los competidores estarían preocupados por ello?

Sergey Levine: La robótica es un área en la que, para ser honestos, el ecosistema no ha sido tan saludable como en otros campos del aprendizaje automático. Lo que quiero decir con esto es que la visión por computadora y el PNL son disciplinas que se prestan de manera natural a un ecosistema basado en el aprendizaje automático porque existen datos disponibles de forma gratuita. La gente asume con naturalidad que va a utilizar el aprendizaje. No hay preocupaciones tan graves sobre la seguridad física. Con razón, a la gente le preocupa la seguridad de la IA, pero no es lo mismo que un dispositivo físico causando daños físicos. Debido a esto, resulta un poco más fácil poner en marcha un esfuerzo de aprendizaje automático a gran escala muy serio en esos campos.

Tradicionalmente, la robótica no es una disciplina que adopte verdaderamente el intercambio de datos, por ejemplo. Cuanta más actividad haya en torno al aprendizaje en la robótica, más creo que cambiará la mentalidad de las personas hacia este futuro en el que aceptamos que los robots serán controlados por modelos aprendidos, y no por controladores diseñados a mano. Habrá datos, y esos datos tendrán que compartirse, porque es imposible que una sola empresa construya un verdadero modelo base en un sector vertical único. Básicamente, esto transformará toda la concepción sobre la robótica para que se parezca más a cómo pensamos sobre la visión y el PNL, en lugar de la automatización industrial tradicional. En ese sentido, por mucho que esté orgulloso del trabajo que hacemos en Physical Intelligence, creo que se necesitará más de una empresa para inclinar la mentalidad de todos en esa dirección.

La robótica china y la dinámica del ecosistema

Anfitrión: Como espectador, veo en Twitter estas demostraciones realmente impresionantes de la robótica china. Da la sensación de que llevan ventaja en cierto sentido, pero no tengo esa experiencia profunda en el sector. Sentía curiosidad por conocer tus opiniones sobre la robótica en China y si van más adelantados.

Sergey Levine: Creo que algo muy útil y constructivo para quienes trabajamos en esto en Estados Unidos y Europa es preguntarnos cuál es la lección que debemos aprender. Para mí, una lección es que resulta fundamental contar con un ecosistema saludable. Un ecosistema significa que, evidentemente, debe haber buenos investigadores y buenos ingenieros trabajando en estas cosas, y debe existir un código abierto saludable. Pero también significa que las diferentes industrias que contribuyen a la robótica deben ser muy saludables de manera individual. Esas industrias no son solo la informática, el aprendizaje automático y la creación de modelos; también abarcan las cadenas de suministro, la manufactura y la I+D de hardware. Todos estos son aspectos sumamente importantes.

Algunos de estos aspectos son áreas en las que Estados Unidos se desempeña bastante bien, mientras que en otros Estados Unidos ha dejado las cosas un poco de lado. Debemos observar lo que está pasando en el mundo, analizar los excelentes resultados que están produciendo los laboratorios chinos y los de otros países, y extraer la lección de que debemos esforzarnos por construir un ecosistema más saludable. Eso significa invertir en todas las diferentes facetas que contribuyen a esto. No soy una persona de negocios ni de inversiones, por lo que no puedo pretender saber cómo se hace esto, pero es crucial asumir plenamente que se trata de un esfuerzo holístico y no de algo donde podamos encargarnos de una sola parte y externalizar todo lo demás.

Anfitrión: De todas las piezas del ecosistema, ¿hay alguna parte que, de mejorar en Estados Unidos, tuviera el mayor impacto en el avance de la robótica?

Sergey Levine: Sin duda, la disponibilidad de un hardware fiable y de bajo coste es algo muy importante. En la actualidad, gran parte del hardware utilizado para la investigación en robótica proviene de China. Es bueno, relativamente económico, de alta calidad y cumple con los estándares que la gente suele necesitar. Sería fabulosamente útil poder obtener todo eso a nivel nacional también. No creo que haya nada imposible en ello; es simplemente cuestión de asumir que hay que apoyar a todo el ecosistema y no solo a una parte de él.

El ciclo de datos y los hitos de escalado

Anfitrión: Uno puede imaginar que el laboratorio que logre escalar primero será el primero en destacar. Puede existir este efecto de crecimiento exponencial donde el despliegue te ayuda a crecer más rápido, y crecer más rápido te ayuda a desplegar, creando este ciclo virtuoso. ¿Crees que eso ocurrirá en esta industria, donde un laboratorio, ya sea en Estados Unidos o en China, alcance algún punto de inflexión y se distancie de todos los demás?

Sergey Levine: Hay mucho de verdad en eso. Conviene tener presente un detalle importante: hay que escalar lo correcto. Contar con un bucle de retroalimentación positiva eficaz donde más robots desplegados se traduzcan en una mayor capacidad del modelo es la clave. El truco reside en que hay muchas maneras de hacer las cosas mal.

Un ejemplo obvio es si soy una empresa automotriz y tengo un brazo robótico que suelda automóviles en la línea de montaje. Soldar coches todos los días le permite acumular 1.000.000 de soldaduras al mes. Si utilizo simplemente eso como mi ciclo de datos, es poco probable que obtenga algo más capaz que un robot que suelda coches. Dado que el robot ya está ahí y ya suelda coches, la mejora marginal de eso no es tan valiosa. Ese es un ejemplo de por qué hay que escalar lo correcto, porque los datos no son exactamente intercambiables como la electricidad o el petróleo. No puedes simplemente comprar más; tienen que ser heterogéneos. Tienes que escalar lo correcto con la tecnología adecuada y la fuente correcta de aprendizaje diverso. Los datos se parecen más a un programa educativo para tu robot que a un producto básico intercambiable.

Anfitrión: Si piensas en ese ciclo de datos y en lanzar la plataforma adecuada que genere datos importantes para mejorar dicha plataforma, ¿cuándo prevés que empiece a suceder algo así en el mundo?

Sergey Levine: Desde el punto de vista tecnológico, las cosas están avanzando muy rápidamente hacia ese escenario. Un equilibrio particular que debe lograrse y que determinaría significativamente ese calendario es cuánta estructura está dispuesto a admitir alguien. En un extremo, uno podría imaginar saltar directamente a dominios de despliegue completamente desestructurados, como los robots domésticos. Eso podría ser realmente emocionante porque tienes mucha diversidad desde el principio, pero el listón es mucho más alto para ser eficaz y lo suficientemente seguro, ya que la seguridad es un problema mucho mayor cuando hay personas en sus hogares.

En el otro extremo, uno podría imaginar tareas mucho más estructuradas. Quizás no tanto el robot soldador, sino el robot del pasillo de al lado que hace algo un poco más desestructurado. Ese podría ser un dominio más sencillo en el sentido de que hay menos preocupaciones de seguridad, ya que podría estar rodeado de humanos capacitados y la tarea podría ser más predecible, pero el valor marginal de cada bit de datos que obtienes en ese dominio es menor porque hay menos variedad. Podrías despegar antes pero con menor pendiente, o más tarde pero con mayor pendiente, y hay que calibrar eso. Mi impresión es que, sin importar de qué extremo estemos hablando, estamos hablando de un plazo de pocos años en lugar de décadas en este punto. Los casos más estructurados podrían estar ocurriendo ahora o el próximo año. Los menos estructurados podrían tardar unos años más, pero probablemente no una década.

Hoja de ruta, generalización y pruebas en el mundo real

Anfitrión: Mucha gente habla de calendarios y resulta algo nebuloso. Si tuvieras que establecer hitos hacia esa estrella polar de un robot en el hogar, ¿cómo sería esa hoja de ruta?

Sergey Levine: Hay algo muy importante que decir sobre la robótica y que es muy fácil pasar por alto debido al ciclo de exageración y a las demostraciones que publica la gente: lo difícil en la robótica siempre ha sido la generalización. Cuando alguien muestra una demostración de su sistema, la demostración por sí sola no suele dejar claro qué nivel de generalización se está mostrando. Las demostraciones de robots altamente acrobáticos, por ejemplo, son muy emocionantes de ver. Pero por lo general, si es algo ensayado en un escenario, es literalmente solo un espectáculo. No es lo mismo que realizar una tarea de manera fiable cada vez en cualquier hogar.

A menudo, el aspecto de la generalización no parece tan impresionante cuando se analiza de forma aislada, porque la generalización es una propiedad de muchos ensayos, y no de uno solo. Puedes ver al robot haciendo algo bastante mundano y poco impresionante, pero lo emocionante es que lo está haciendo con un objeto que nunca antes había visto en un entorno en el que jamás se había probado. Eso es en realidad más difícil que hacer una voltereta hacia atrás acrobática que ha practicado 1.000.000 de veces.

La hoja de ruta consiste por completo en lograr una mejor generalización y disponer de un mecanismo para obtener más generalización a medida que generalizas. Un paso en esa hoja de ruta es contar con una demostración muy concreta de un sistema robótico que mejore con la experiencia autónoma recopilada en un entorno para el cual no fue entrenado originalmente. Entrenas el modelo en la parte trasera, lo colocas en un nuevo entorno —ya sea un hogar o una fábrica haciendo algo real— y se desenvuelve bien; pero con el tiempo va mejorando cada vez más hasta alcanzar niveles de robustez comercialmente relevantes sin estancarse en el 50%. Ese sería un hito importante. Si se trata verdaderamente de un proceso automatizado que mejora a medida que recopila experiencia útil, puedes colocarlo en muchos dominios diferentes para recopilar experiencia, hacer algo que la gente quiera y mejorar el modelo.

Otro paso importante es demostrar una forma concreta y útil en la práctica de transferir conocimientos de sentido común para lograr robustez. Ese es el escenario en el que no tienes la oportunidad de practicar. Si estás conduciendo por la carretera y ves un camión de bomberos y conos de tráfico, incluso si nunca antes has estado en esa situación, tu sentido común te indica que debes reducir la velocidad en lugar de lanzarte contra los conos. Si puedes aplicar ese sentido común para recuperarte eficazmente de situaciones inesperadas, como cuando el robot metió la espátula en el horno y debe darse cuenta de que necesita sacarla, eso nos indica que podemos usar el sentido común para corregir errores.

Anfitrión: Podría imaginar un robot de enfoque más acotado, como un robot humanoide haciendo un solo paso en una línea de montaje. Por lo que entiendo, te interesa menos eso porque no representa realmente un paso hacia la inteligencia general.

Sergey Levine: No es que me interese menos. Lo que ocurre es que el mundo real tiene abstracciones imperfectas que hacen que ese tipo de cosas sean mucho más complejas de lo que parecen. En la década de 1990, cuando la gente comenzó a trabajar a toda máquina en la conducción autónoma, existía la idea de que podíamos evitar muchos de los problemas difíciles instrumentando el entorno, colocando sensores magnéticos a lo largo de la carretera y transmisores en los coches para que supieran dónde está cada uno, de manera similar a los aviones. La gente pensaba que no necesitábamos una IA sofisticada, solo sensores, y que funcionaría. Eso no llegó a ninguna parte porque el mundo real tiene muchísimas excepciones desordenadas y casos especiales. Incluso si los sensores magnéticos funcionan el 99% de las veces, ese 1% en el que alguien pisa la carretera o hay un trozo de basura lo echa todo a perder.

Lo que realmente funcionó fue decidir no evitar el problema difícil, desplegar los coches directamente en entornos complejos como San Francisco y lidiar con ello de frente. La manipulación robótica va a funcionar de la misma manera. Más allá del mundo totalmente estructurado de la fábrica, si quieres salir aunque sea un poco de ese ámbito, incluso si el 99% de las veces es sencillo, ese 1% en el que ocurre algo extraño significa que se debe abordar el problema en toda su magnitud.

Anfitrión: Esto me recuerda a cuando Figure hizo una demostración en la que transmitieron en directo al robot clasificando paquetes. En tu opinión, ¿eso demuestra generalización?

Sergey Levine: Sí, creo que sí. Esto es algo que me parece muy alentador. Dado que es difícil mostrar la generalización en un vídeo, mucha gente está pensando de forma creativa en cómo presentar algo de un vistazo, utilizando demostraciones en directo y secuencias a cámara rápida prolongadas. Esa es una excelente manera de elevar la importancia de la generalización en la conciencia de la gente.

Cuando estábamos trabajando en el proyecto de RL del modelo π*0 a finales del año pasado, queríamos hacer algunos experimentos a más largo plazo. Pusimos a nuestro robot a ensamblar cajas en la fábrica Dandelion Chocolate durante varios días. También teníamos una tarea de café en la que el robot utilizaba una máquina de espresso para preparar café, funcionando durante 13 horas preparando bebidas. Intentamos ser respetuosos con el medio ambiente y no tirar el café, así que después de 13 horas todo el mundo en la oficina estaba hiperactivo por haber tomado tanto espresso. Falló unas cuantas veces, como cuando derramó posos de café y tuvo que limpiarlos con un trapo, pero nada explotó durante esas 13 horas.

Anfitrión: Cuando derramó los posos del café y los limpió, ¿lo hizo por sí mismo?

Sergey Levine: La forma en que se realizó ese experimento es que hay indicaciones de alto nivel que se actualizan aproximadamente cada 5 minutos entre tareas semánticamente coherentes. Le dices que prepare espresso o que limpie la máquina, por lo que la orden de limpiar fue indicada por una persona. En principio, podríamos automatizar eso. Ahora estamos dedicando mucho esfuerzo a mejorar nuestra política de alto nivel que gestiona esos comandos. Para ese experimento, cada 5 minutos alguien actualizaba lo que se le pedía que hiciera, al igual que pedir un latte en una cafetería, excepto que también tenías que decirle que limpiara antes de preparar el siguiente.

Anfitrión: OpenAI, Anthropic, Cursor y Vercel utilizan este producto para mejorar sus operaciones. El problema que resuelve es que, cuando estás creando un producto de SaaS o de IA y quieres venderlo a otras empresas, existen todos estos requisitos que debes cumplir: SSO, SCIM, RBAC, registros de auditoría. Integrar todo esto lleva tiempo pero no es el núcleo principal de tu aplicación. WorkOS es una capa de API que te permite cumplir con todos estos requisitos en tan solo unas pocas líneas de código. Echa un vistazo en workos.com para obtener más información y empezar. Les agradezco que patrocinen este podcast.

Tipos de datos y transferencia entre distintas morfologías

Anfitrión: En el camino hacia la generalización, los datos son una parte muy importante. Están los datos simulados y los datos interactivos físicos. ¿Cuál es tu opinión sobre cuáles son los mejores datos, cuáles los peores, y cuáles son sus ventajas e desventajas?

Sergey Levine: Hay mucha discusión en la comunidad robótica sobre este tema, y la gente sostiene opiniones opuestas. Mi punto de vista es que al modelo le resulta mucho más fácil internalizar muchas fuentes de datos diferentes si es capaz de fundamentarlas en una sólida comprensión física del mundo.

Si quieres aprender a pilotar un avión, probablemente utilices un simulador durante parte de tu entrenamiento. El simulador te resulta comprensible porque aportas una gran cantidad de conocimientos sobre el mundo para fundamentar lo que está sucediendo. Sabes que estás adquiriendo conocimientos para utilizarlos en un avión real. De igual forma, si ves a alguien cocinando, aunque no sientas sus movimientos musculares exactos, tienes conocimientos previos para clasificarlo en el nivel abstracto de añadir sal sin necesidad de calcular las trayectorias de sus articulaciones. Una vez que comprendes cómo hacer las cosas físicamente con tu propio cuerpo, todas las demás fuentes de conocimiento pueden conectarse a ello porque tu base corpórea lo fundamenta todo.

Si tenemos un modelo base robótico entrenado con una gran cantidad de datos corpóreos reales que proporcionan esa base, es muy posible que sea mucho mejor capaz de absorber otras fuentes de conocimiento. Al observar el éxito de los datos de internet para los LLM, resulta tentador empezar con vídeos de YouTube y añadir datos de robots encima de eso, pero creo que es al revés. Mi colega Sudeep, junto con Samarth de Georgia Tech, tomó nuestro modelo base robótico y añadió datos de vídeo humano encima de un modelo entrenado inicialmente con datos de robots. Al utilizar un modelo pequeño con un mínimo de datos de robots, la experiencia humana y la experiencia del robot estaban completamente separadas en las representaciones de características. Pero cuando se entrenó con una gran cantidad de datos de robots procedentes de muchos robots diferentes, las características se agruparon enteramente por la identidad de la tarea en lugar de por la morfología. En las incrustaciones t-SNE, llevadas al 100% de datos de robots, la identidad de la tarea se alineaba claramente con una sensibilidad mínima hacia la morfología. El modelo base no había sido entrenado con datos humanos en absoluto, pero una vez que añades datos humanos, los representa exactamente de la misma manera.

Anfitrión: ¿Es importante que el modelo base tenga datos recopilados utilizando ese conjunto específico de motores y articulaciones?

Sergey Levine: Hemos invertido un gran esfuerzo en crear modelos multiplataforma que gestionen muchos tipos de robots, pero por lo general se necesitan algunos datos del robot de destino para obtener un buen rendimiento. La métrica de la generalización no es la transferencia de cero disparos a un nuevo robot, sino arreglárselas con menos experiencia en el nuevo robot mediante la transferencia de habilidades de otros.

La cantidad de arquitectura especial necesaria es sorprendentemente mínima. Al principio, tenía una larga lista de ideas de investigación para adaptarme a diferentes morfologías, como la factorización de representaciones para un brazo de 6 grados de libertad frente a uno de 7 grados de libertad. No hicimos nada de eso. El modelo genera un vector de números y, si el robot tiene menos grados de libertad, simplemente rellena la salida con ceros. Se entrena en todos los robots y emite acciones en función de lo que ve a través de la cámara.

Para transferir habilidades entre robots, el pensamiento intermedio ayuda. Pensar en texto es bueno para transferir la estructura de comportamiento de alto nivel, como saber que hay que abrir un cajón antes de guardar los cubiertos. Para tareas físicas de nivel inferior, realizamos un experimento en el que la fase de pensamiento se expresa en imágenes, generando una imagen del siguiente hito en la tarea. Con eso, conseguimos que un robot UR5 doblara una camiseta a pesar de que no teníamos ningún dato sobre cómo doblar camisetas en ese robot específico. Generar una imagen de cómo se ve una camiseta doblada es sencillo con un modelo generativo, y deducir los ángulos articulares necesarios a partir de esa imagen sintetizada es relativamente simple. Introducir un pensamiento intermedio en la modalidad adecuada hace que la generalización entre diferentes morfologías sea mucho más sencilla.

Simplicidad de la pila robótica frente a los vehículos autónomos

Anfitrión: Antes mencionaste que Waymo resultaba inspirador como prueba de la robótica generalizada. En el caso de la robótica humanoide, ¿qué te da confianza en un cronograma de pocos años frente a la larga cola de casos límite y desafíos de políticas a los que se enfrentaron los vehículos autónomos?

Sergey Levine: Una gran diferencia entre los modelos base de robótica y los sistemas de ingeniería tradicionales es que la pila de software es realmente ligera. Entrenar un modelo base es difícil debido a la selección y el etiquetado de datos, pero el software real que se ejecuta en el robot es muy sencillo. En términos de líneas de código puras, es mucho más pequeño que una pila de vehículos autónomos tradicional. Los vehículos autónomos comenzaron antes con tecnologías heredadas muy diferentes y tienen severas restricciones críticas de seguridad. Dejar caer un objeto frágil con un manipulador robótico es mucho menos catastrófico que un coche atropellando a alguien.

Los desafíos de seguridad en la robótica son reales, pero no constituyen un freno tan definitivo para el despliegue práctico. Puedes seleccionar tareas, entornos y hardware donde esos riesgos sean manejables. La combinación de una pila de software radicalmente más sencilla, obstáculos de seguridad menos drásticos y el ciclo positivo de datos hace que los plazos de pocos años sean realistas.

Análisis previo al fracaso sobre los modos de fallo de la robótica humanoide

Anfitrión: Si la robótica humanoide no tuviera éxito en un plazo de pocos años, ¿cuál sería la razón más probable de su fracaso?

Sergey Levine: Para que estos sistemas sean verdaderamente útiles, deben alcanzar un nivel de fiabilidad y generalización superior al que esperamos de los LLM o de los modelos de generación de vídeo. Los LLM son herramientas de interacción humana en las que el usuario puede iterar sobre las indicaciones hasta que se resuelve una tarea. Con un robot, toda la propuesta de valor depende de la ejecución autónoma. Hacer que un humano intervenga constantemente arruina el propósito.

El mayor riesgo es la dificultad de alcanzar ese alto nivel de robustez. Las técnicas de aprendizaje por refuerzo que aprovechan la experiencia autónoma pueden ayudar a cerrar la brecha del 95% al ​​100%, pero cruzar ese último tramo sigue siendo un desafío técnico abierto que requiere más innovación algorítmica.

Modelos base frente a especialistas enfocados

Anfitrión: En las arquitecturas de modelado robótico, ¿todo el mundo está haciendo lo mismo o existen posturas encontradas?

Sergey Levine: Hay más heterogeneidad de la que parece. La principal línea divisoria se encuentra entre adoptar plenamente la filosofía de los modelos base frente a centrarse en áreas verticales estrechas. La filosofía del modelo base sostiene que, para resolver una tarea especializada, es mejor entrenar un modelo general con una amplia variedad de datos, lo que en última instancia superará a un especialista enfocado en casos límite.

En robótica, esa idea incomoda a la gente. Si quieres construir un sistema de automatización para almacenes, recopilar datos sobre cómo guardar cubiertos en cocinas parece contradictorio. Sin embargo, recopilar datos diversos construye habilidades generalizadas que se transfieren a casos límite impredecibles en el almacén. Aceptar que la amplitud supera a la optimización vertical estrecha sigue siendo difícil para los ingenieros de robótica tradicionales.

Seguridad de la IA en el mundo físico

Anfitrión: Si Physical Intelligence desarrolla un modelo general extraordinariamente capaz, ¿cómo abordas la seguridad de la IA, los riesgos y la regulación en los sistemas físicos?

Sergey Levine: La seguridad de la IA se ha estudiado durante mucho tiempo, pero cuando la tecnología avanza con rapidez, los problemas reales dependen en gran medida de cómo la sociedad adopta las herramientas. nuestra filosofía es la experimentación empírica: desplegar sistemas en el mundo real, observar qué funciona y qué falla, y ajustarlos de forma iterativa. Si la IA basada exclusivamente en software genera importantes problemas de seguridad, los sistemas de IA física capaces de interactuar con el mundo físico requerirán naturalmente un escrutinio aún mayor.

Impacto económico y el futuro del trabajo

Anfitrión: Si todo va bien durante los próximos 10 años, ¿la robótica humanoide significa el fin del trabajo humano?

Sergey Levine: Es un error pensar en los robots simplemente como personas mecánicas. Cuando despegaron las computadoras personales, no reemplazaron a los cerebros humanos; en su lugar, vimos proliferar la computación ubicua en escritorios, bolsillos, refrigeradores y automóviles. Por analogía, la IA física probablemente introducirá el accionamiento físico ubicuo, brindando asistencia automatizada en tareas cotidianas en lugar de actuar como un reemplazo directo uno a uno de los humanos. Los agentes de programación modernos sirven como un buen paralelo: en lugar de eliminar a los ingenieros de software, proporcionan apalancamiento para amplificar la productividad humana.

Artículos de investigación esenciales: Aloha y ACT

Anfitrión: Si alguien quiere entender la línea de avances en robótica, ¿qué artículos fundamentales debería leer?

Sergey Levine: Señalaría el artículo original de Aloha y Action Chunking with Transformers (ACT) liderado por Tony Zhao, del cual soy coautor. El artículo demostró que el uso de brazos económicos para aficionados de 7.000 dólares de Trossen Robotics en una configuración de teleoperación bimanual, combinados con un modelo transformer sencillo, podía resolver tareas de alta destreza como reemplazar las pilas de un mando a distancia o poner un zapato en el pie de un maniquí.

La investigación académica a menudo prioriza la complejidad matemática, pero la revelación aquí fue que un hardware sencillo y accesible combinado con la configuración de aprendizaje de extremo a extremo adecuada podía lograr resultados notables. La base de código abierta de ACT se ha convertido en un kit de inicio estándar para el aprendizaje robótico moderno porque demuestra hasta dónde pueden llegar los componentes básicos sencillos.

La evolución de los controles clásicos a la IA basada en aprendizaje

Anfitrión: Antes del aprendizaje automático moderno, Boston Dynamics acaparaba una enorme atención con demostraciones impresionantes, pero hoy en día se oye compararativamente menos sobre los enfoques clásicos. ¿Qué impulsó ese cambio en la industria?

Sergey Levine: La robótica requiere una integración de pila completa que abarque el diseño mecánico, el accionamiento y la toma de decisiones de alto nivel. Las demostraciones clásicas de Boston Dynamics mostraban un hardware excepcional y una ingeniería de control sofisticada diseñada a mano. En ese momento, eso era fundamental porque, sin un hardware funcional, el software de toma de decisiones carece de relevancia.

Hoy en día, el hardware es lo suficientemente bueno y el principal cuello de botella es la toma de decisiones en bucle cerrado en entornos desestructurados. La línea divisoria entre los controles clásicos y la IA moderna se reduce a si el robot solo necesita controlar su propio cuerpo o si debe reaccionar ante el mundo exterior. Hacer una voltereta hacia atrás en un terreno plano es principalmente un problema de control que involucra el cuerpo del robot. Recoger una taza de café requiere comprender el entorno externo. Si un ingeniero humano puede diseñar a mano una ley de control para un comportamiento, eso sirve como prueba de la existencia de una política compacta y generalizable que se puede aprender directamente a través del aprendizaje automático.

Consejos para mi yo más joven sobre el conocimiento previo

Anfitrión: Si pudieras retroceder en el tiempo hasta cuando ingresaste a la industria, ¿qué consejo te darías a ti mismo?

Sergey Levine: Me diría a mí mismo que tomara el conocimiento previo mucho más en serio. Al principio, muchos investigadores, incluyéndome a mí, creían que los robots debían aprender completamente desde cero. Durante el proyecto Arm Farm en Google, tuvimos brazos tomando millones de objetos desde una pizarra en blanco. Aprendieron a agarrar, pero esos datos no sirvieron fácilmente para impulsar habilidades más complejos.

Los animales y los humanos no aprenden en el vacío; confían en la observación y en modelos existentes del mundo. Incorporar un amplio conocimiento previo, ya sea a través del lenguaje, vídeos de internet o datos de múltiples morfologías, proporciona el andamiaje necesario para un aprendizaje eficiente. Intentar aprender sin conocimientos previos obliga al robot a resolver un problema estrictamente más difícil de lo que la naturaleza tuvo que resolver jamás.

Anfitrión: Muchas gracias por tu tiempo, Sergey.

Sergey Levine: Gracias a ti por las preguntas.

Anfitrión: Gracias por ver este podcast. Si lo has disfrutado, por favor deja un comentario y un 'me gusta'. También estoy trabajando en la construcción de un prototipo de teclado ergonómico dividido. Nos lanzamos en Kickstarter y alcanzamos nuestra meta de financiación en 8 horas. Las herramientas ya están en marcha y los patrocinios tardíos siguen abiertos. Gracias por ver el vídeo y nos vemos en el próximo episodio.

Aviso legal: Este artículo es solo para fines informativos y no constituye asesoramiento de inversión ni una recomendación para comprar, vender o mantener ningún valor. Nuestros analistas ofrecen una cobertura detallada de eventos corporativos, pero pueden cometer errores; siempre realiza tu propia investigación. Los puntos de vista y opiniones expresados no reflejan necesariamente los de DruckFin. No hemos verificado de forma independiente toda la información utilizada aquí, y puede contener errores u omisiones. Antes de tomar cualquier decisión de inversión, consulta a un asesor financiero calificado. DruckFin y sus afiliados no asumen ninguna responsabilidad por cualquier pérdida que surja de la confianza en este contenido. Para los términos completos, consulta nuestros Términos de Uso.