Siguenos en

NVIDIA presenta los World Action Models para impulsar la próxima generación de robots con IA

·
·

NVIDIA ha presentado un nuevo enfoque para la robótica basado en los denominados World Action Models (WAM), una arquitectura diseñada para que los robots comprendan cómo evoluciona el mundo físico antes de actuar. La compañía sostiene que este cambio podría mejorar significativamente la capacidad de generalización, reducir la necesidad de datos de entrenamiento y acelerar el desarrollo de robots autónomos.


De los Vision-Language-Action a los World Action Models

Hasta ahora, gran parte de la robótica moderna ha utilizado modelos Vision-Language-Action (VLA), que combinan visión artificial, comprensión del lenguaje y generación de acciones.

Sin embargo, NVIDIA considera que estos modelos presentan una limitación importante: entienden lo que observan, pero no predicen cómo cambiará el entorno tras una acción.

Los nuevos World Action Models (WAM) incorporan un modelo del mundo basado en vídeo, permitiendo que el robot anticipe la evolución física de la escena antes de ejecutar un movimiento.

Cosmos 3 será la base del nuevo sistema

El núcleo de esta nueva arquitectura es Cosmos 3, el modelo fundacional multimodal de NVIDIA, entrenado con:

  • 767 millones de imágenes.
  • 348 millones de vídeos del mundo real.
  • 8 millones de muestras de acciones robóticas.

Gracias a este entrenamiento, Cosmos 3 desarrolla un conocimiento previo sobre la física del entorno, facilitando posteriormente la adaptación a diferentes tareas robóticas.

Menos datos y mayor capacidad de adaptación

Según NVIDIA, los World Action Models ofrecen varias ventajas frente a los modelos tradicionales:

  • Aprenden principios físicos en lugar de memorizar demostraciones.
  • Generalizan mejor en escenarios desconocidos.
  • Requieren menos ejemplos para adaptarse a nuevos robots.
  • Permiten reutilizar datos de múltiples dominios para mejorar el aprendizaje.

Esto podría reducir considerablemente el coste y el tiempo necesarios para entrenar nuevos sistemas de manipulación robótica.

Robots capaces de imaginar el resultado antes de actuar

Uno de los aspectos más destacados de Cosmos 3 es que el modelo puede generar simultáneamente:

  • Las acciones que debe ejecutar el robot.
  • Una predicción en vídeo de cómo evolucionará la escena tras esas acciones.

De esta forma, el robot «imagina» el resultado antes de realizar el movimiento, mejorando la planificación y la toma de decisiones.

NVIDIA apuesta por una robótica más abierta

La compañía también anunció que Cosmos 3 estará disponible con modelos abiertos para uso comercial, incluyendo:

  • Pesos del modelo.
  • Conjuntos de datos.
  • Herramientas de evaluación.
  • Recetas de entrenamiento.
  • Infraestructura de despliegue.

Con ello, NVIDIA busca acelerar el desarrollo de robots inteligentes capaces de operar en entornos cada vez más complejos utilizando una única base tecnológica adaptable a múltiples plataformas.

RELACIONADO

CALENDARIO ECONÓMICO

Accede a nuestro calendario económico y mantente al día con los eventos clave.
Recientes
Próximos
spot_img

DESTACADO

TE INTERESA