Siguenos en

NVIDIA AVO alcanza el 100% en ARC-AGI-3 y demuestra el potencial de los agentes de IA autónomos

·
·

NVIDIA ha logrado que su arquitectura de agentes AVO complete los 183 niveles del conjunto público de ARC-AGI-3 con una puntuación RHAE perfecta de 100. El resultado refuerza una idea clave para la próxima generación de inteligencia artificial: el rendimiento de un agente depende no solo del modelo utilizado, sino también de su memoria, herramientas, supervisión y capacidad para trabajar de forma autónoma durante largos periodos.


NVIDIA lleva AVO al 100% en ARC-AGI-3

NVIDIA presentó este 21 de agosto nuevos resultados de Agentic Variation Operators (AVO), su arquitectura experimental diseñada para ejecutar tareas autónomas complejas durante horizontes prolongados.

Utilizando Claude Opus 5 como modelo subyacente, AVO consiguió una puntuación RHAE de 100,00 en los 25 entornos públicos de ARC-AGI-3, completando los 183 niveles disponibles.

El resultado resulta especialmente relevante porque ARC-AGI-3 obliga a los agentes a enfrentarse a entornos desconocidos sin instrucciones, reglas explícitas ni objetivos previamente indicados.

El sistema debe experimentar, observar las consecuencias de sus acciones y descubrir por sí mismo cómo funciona cada entorno.

De aproximadamente un 30% del modelo al 100% como sistema completo

Uno de los aspectos más llamativos de la investigación está en la diferencia entre evaluar únicamente el modelo y evaluar todo el sistema de agente.

ARC Prize reporta aproximadamente un 30% para Claude Opus 5 con High reasoning effort en el conjunto público. NVIDIA consiguió completar el 100% utilizando la misma familia de modelos dentro de una arquitectura completamente diferente.

Sin embargo, NVIDIA advierte expresamente que no debe interpretarse como una comparación directa ni como prueba de que AVO por sí solo aporte los 70 puntos restantes, ya que cambian el nivel de razonamiento, la arquitectura del agente y otras condiciones de evaluación.

El experimento sí demuestra una cuestión importante: medir únicamente las capacidades de un modelo no permite conocer necesariamente el rendimiento final de un agente construido alrededor de él.

Memoria persistente y supervisión para trabajar durante largos periodos

AVO funciona como un sistema completo alrededor del modelo de lenguaje.

Puede inspeccionar y modificar código, ejecutar comandos, consultar documentación y validar los resultados de sus propias acciones. Su principal característica es la capacidad de mantener operaciones autónomas durante horizontes prolongados.

NVIDIA destaca dos componentes fundamentales: memoria persistente y supervisión.

La memoria conserva implementaciones anteriores, resultados de evaluaciones y otra información relevante para evitar que el agente tenga que reconstruir constantemente lo que ya ha aprendido.

Mientras tanto, un supervisor analiza la trayectoria general del agente y puede redirigirlo hacia estrategias diferentes cuando detecta estancamiento o ciclos improductivos.

AVO necesitó 6.624 acciones para completar los 183 niveles

La eficiencia también fue uno de los puntos destacados.

AVO completó los 183 niveles utilizando 6.624 acciones, frente a las 7.542 acciones reportadas por VISTA utilizando también Claude Opus 5.

Eso representa aproximadamente un 12% menos de acciones para AVO.

NVIDIA vuelve a advertir que no se trata de una prueba controlada entre ambas arquitecturas, ya que existen diferencias en representación de observaciones, memoria, gestión del contexto y otros elementos.

GPT-5.6 Sol también fue probado con AVO

NVIDIA también realizó experimentos limitados utilizando GPT-5.6 Sol dentro de la arquitectura AVO.

En un subconjunto de juegos especialmente difíciles, Sol alcanzó niveles equivalentes más rápidamente en tiempo real en varios casos, mientras que Claude Opus 5 necesitó menos acciones para alcanzar niveles comparables.

Los resultados son preliminares y NVIDIA señala que será necesaria una evaluación sistemática más amplia antes de extraer conclusiones definitivas sobre las diferencias entre ambos modelos.

AVO ya había demostrado autonomía durante siete días consecutivos

Antes de ARC-AGI-3, NVIDIA había utilizado AVO para una tarea completamente diferente: optimización autónoma de kernels para GPU.

En uno de los experimentos, AVO trabajó continuamente durante siete días, exploró más de 500 posibles direcciones de optimización y produjo 40 versiones de kernels.

En sistemas NVIDIA DGX B200, los kernels de atención multihead resultantes superaron a cuDNN hasta en un 3,5% y a FlashAttention-4 hasta en un 10,5% dentro de las configuraciones evaluadas.

Posteriormente, el agente adaptó el kernel a grouped-query attention mediante aproximadamente 30 minutos adicionales de trabajo autónomo.

NVIDIA apunta hacia agentes capaces de trabajar durante horizontes cada vez mayores

Para NVIDIA, uno de los principales resultados de ARC-AGI-3 no es simplemente alcanzar una puntuación perfecta.

La compañía destaca que la misma arquitectura diseñada inicialmente para ingeniería y optimización de GPU consiguió trasladarse a un problema de razonamiento interactivo completamente diferente.

La investigación apunta hacia sistemas donde la inteligencia del modelo constituye solo una parte de la ecuación.

Memoria persistente, herramientas, retroalimentación del entorno, recuperación ante errores y gestión del contexto pueden convertirse en componentes fundamentales para construir agentes capaces de mantener tareas autónomas durante horas, días o incluso periodos superiores.

Como resume NVIDIA en su investigación: el modelo importa, pero el modelo no constituye por sí solo todo el agente.

RELACIONADO

CALENDARIO ECONÓMICO

Accede a nuestro calendario económico y mantente al día con los eventos clave.
Recientes
Próximos
spot_img

DESTACADO

TE INTERESA