Nueva técnica de IA que permite a los robots completar tareas el doble de rápido pensando con anticipación

4 octubre, 2026

Un equipo de científicos ha diseñado un nuevo sistema de inteligencia artificial (IA) que reduce los retardos de reacción en los robots en más de 10 veces sin usar potencia computacional adicional.

Muchos robots controlados por modelos de visión-lenguaje-acción (VLA) se mueven a saltos: alcanzar, pausar, ajustar, pausar de nuevo. El problema proviene en gran parte de la forma en que normalmente se ejecutan estos modelos: después de completar un conjunto de instrucciones, el robot espera a que el modelo calcule el siguiente, lo que genera un ritmo de detención y avance. Este retardo de reacción es una barrera importante para utilizar robots controlados por VLA en tareas que exigen interacción continua y en tiempo real.

Un nuevo sistema llamado “VLASH” intenta eliminar esa espera al planificar las próximas acciones mientras el robot completa las actuales. En las pruebas, los robots que usaron VLASH realizaron algunas tareas entre 1.5 y 2 veces más rápido, manteniendo la mayor parte o la totalidad de su precisión. La latencia de reacción máxima cayó hasta 11.8 veces, dependiendo del hardware informático utilizado.

Investigadores del MIT; Nvidia; Caltech; la Universidad de California, Berkeley; la Universidad de California, San Diego; y la Universidad de Tsinghua en China describieron el sistema en un artículo subido al servidor de preprints arXiv y lo presentarán en la Conferencia Internacional sobre Robots Inteligentes y Sistemas este otoño.

Una versión anterior del artículo reportó una aceleración de más de 30 veces, pero los investigadores dijeron a Live Science que esas pruebas usaron secuencias de acciones más largas y hardware más lento. Los experimentos más recientes utilizaron secuencias de acciones más cortas, más comunes y GPUs más potentes. “La cifra de 11.8x puede representar mejor los ajustes prácticos recientes”, dijeron los autores del estudio a Live Science en un correo electrónico.

Los robots reciben una actualización de su cerebro

Los modelos VLA actúan como el cerebro de muchos robots avanzados. Combinan imágenes de una cámara con instrucciones humanas e información sobre el estado actual del robot, y luego traducen esa información en movimientos físicos. A medida que el robot completa un grupo de acciones, VLASH utiliza su posición actual y los movimientos programados para estimar dónde terminará. A partir de ese estado proyectado, la IA planifica el siguiente grupo de acciones.

VLASH predice al robot, no el mundo que lo rodea. Predecir todo el entorno con un modelo del mundo puede requerir más tiempo de cómputo, lo que lo hace menos útil cuando se necesitan reacciones muy rápidas. Los dos enfoques podrían, en algún momento, funcionar juntos, dijeron los investigadores.

Es como planificar tu próximo paso antes de que tu pie toque el suelo, en lugar de esperar a que aterrice para decidir a dónde ir.

Los investigadores probaron dos modelos VLA en dos plataformas robóticas, utilizando una laptop con una GPU Nvidia RTX 5090. Evaluaron tareas de recogida y colocación, apilamiento y clasificación, ejecutando 20 pruebas por método, además de desafíos de reacción rápida, como tenis de mesa y Whac-a-Mole. Medían por separado la latencia de reacción en varias unidades de procesamiento.

Como VLASH estima el estado futuro del robot a partir de movimientos ya programados, no requiere un modelo de predicción separado ni un paso adicional de inferencia en tiempo de ejecución.

Preparando máquinas para el mundo real

Los investigadores también reorganizaron los datos de entrenamiento existentes para acelerar el ajuste fino. En un benchmark, cada paso de entrenamiento fue 3.26 veces más rápido mientras alcanzaba una precisión comparable. Eso no significa que el entrenamiento total sea 3.26 veces más rápido o más barato, advirtieron los investigadores, porque el costo total también depende del modelo, del hardware, de los datos y del número de pasos de entrenamiento.

El tenis de mesa y Whac-a-Mole pusieron a prueba las reacciones de VLASH. En ambos, el objetivo podía moverse mientras el robot todavía calculaba qué hacer.

VLASH no intenta predecir esos movimientos. En cambio, procesa nuevas observaciones 15 a 30 veces por segundo, lo que le permite detectar rápidamente cambios como que un objeto se esté moviendo, dijeron los investigadores.

Sin embargo, este aumento de velocidad no aborda la seguridad del robot alrededor de las personas. Roshni Lulla, cofundadora y directora de investigación del Institute for Humane Robotics, que no participó en la investigación, advirtió que reacciones más rápidas no necesariamente hacen a un robot más seguro. “Reaccionar más rápido es una ventaja real, pero el caso para una mayor seguridad no me queda claro”, explicó.

Los investigadores dijeron que las tareas de manipulación que requieren movimiento continuo y respuestas rápidas probablemente se beneficiarían primero. Eso podría, con el tiempo, incluir la fabricación y otros entornos donde los objetos se mueven y los planes cambian. Pero Lulla comentó que la prueba más reveladora sería colocar estos robots entre personas. “La pregunta real es cómo cambia esto el rendimiento robótico en entornos centrados en el ser humano”, dijo. “Me gustaría ver pruebas realizadas con un humano presente en la habitación, cuando el estado del entorno podría ser modificado por otro agente.”

La búsqueda y rescate es una posibilidad más lejana. VLASH no ha sido probado en condiciones de poca iluminación, humo, terreno inestable, ni con cámaras dañadas o comunicaciones poco confiables. Su desempeño en esas condiciones dependería en gran medida del modelo VLA subyacente, dijeron los investigadores.

VLASH podría, en última instancia, combinarse con modelos del mundo más avanzados que predicen cambios en el entorno más amplio. Sin embargo, primero los investigadores deben probarlo en más robots, modelos VLA, tareas y entornos, así como en experimentos más largos y con perturbaciones inesperadas.

Lulla dijo que los resultados apoyan una conclusión relativamente estrecha. “Podemos afirmar razonablemente que esta nueva metodología elimina un cuello de botella en términos de tiempo de procesamiento y conserva las capacidades”, dijo. Pero añadió: “Lo que no diría es que representa un avance significativo en seguridad o en inteligencia.”

“Más que cualquier demostración aislada, buscaríamos ganancias consistentes en muchos robots, tareas, entornos y pruebas de larga duración, junto con la validación adecuada de fiabilidad y seguridad”, dijeron los autores del estudio. Por ahora, VLASH demuestra que los robots pueden pasar menos tiempo esperando para decidir qué hacer a continuación. Queda por ver si esas reacciones más rápidas se sostienen fuera del laboratorio.

Lucía Benítez

Soy periodista y redactora en El Disparador Uruguay. Me interesan especialmente la ciencia, la salud, los viajes, los animales y esas historias que ayudan a mirar el mundo con un poco más de curiosidad.