Siguenos en

OpenAI confirma que GPT-6 Astra alcanza un nivel crítico de capacidad en ciberseguridad

·
·

Astra es el primer modelo de OpenAI clasificado en el nivel “crítico” de ciberseguridad: puede descubrir vulnerabilidades desconocidas, desarrollar exploits funcionales y construir cadenas completas de ataque contra sistemas reforzados sin necesitar instrucciones humanas paso a paso.


OpenAI eleva Astra al nivel crítico

OpenAI ha publicado nuevos detalles sobre las capacidades de GPT-6 Astra, su modelo de inteligencia artificial de nueva generación.

Después de realizar evaluaciones adicionales, la compañía concluyó que Astra alcanza el umbral de capacidad crítica de ciberseguridad definido dentro de su Marco de Preparación.

Es la primera vez que OpenAI clasifica uno de sus modelos en este nivel.

La diferencia respecto a generaciones anteriores es importante: con las herramientas y permisos adecuados, Astra puede encontrar vulnerabilidades hasta entonces desconocidas y desarrollar métodos para explotarlas en sistemas bien protegidos sin que una persona tenga que dirigir cada paso del proceso.

Astra obtiene un 100% en ExploitBench

Una de las pruebas utilizadas por OpenAI fue ExploitBench, diseñada para medir la capacidad de un modelo para desarrollar exploits a partir de vulnerabilidades conocidas.

Astra consiguió una puntuación perfecta del 100%.

OpenAI también construyó una evaluación interna con 20 vulnerabilidades recientes de alta gravedad para reducir el riesgo de que el modelo hubiera encontrado previamente las respuestas dentro de sus datos.

En estas pruebas, Astra consiguió tasas de ejecución arbitraria de código considerablemente superiores a GPT-5.6 Sol utilizando, además, muchos menos tokens de salida.

El modelo descubrió dos vulnerabilidades de día cero

El resultado más importante apareció durante evaluaciones más avanzadas.

Según OpenAI, Astra consiguió descubrir y utilizar dos vulnerabilidades de día cero como parte de una cadena de exploits.

Una vulnerabilidad zero-day es especialmente delicada porque todavía no ha sido corregida o incluso puede ser desconocida para los responsables del software afectado.

OpenAI asegura que está notificando ambas vulnerabilidades a sus respectivos mantenedores.

Astra consiguió escapar del aislamiento de un navegador

Las capacidades fueron todavía más lejos durante evaluaciones realizadas por expertos.

Astra descubrió vulnerabilidades desconocidas dentro de un navegador reforzado y consiguió convertirlas en una cadena completa de exploits.

El ataque experimental logró escapar del entorno aislado o sandbox del navegador y ejecutar comandos en el sistema anfitrión después de abrir un archivo HTML.

En otra evaluación sobre un sistema operativo reforzado, Astra encontró varias vulnerabilidades y las combinó para realizar una escalada local de privilegios desde un usuario sin permisos hasta root.

Estos resultados fueron determinantes para que OpenAI concluyera que el modelo alcanza el nivel crítico.

Astra supera ampliamente a GPT-5.6 Sol

OpenAI describe Astra como un salto considerable respecto a GPT-5.6 Sol en tareas de ciberseguridad.

Además de encontrar vulnerabilidades y desarrollar exploits con mayor eficacia, utiliza los tokens de forma mucho más eficiente.

Pero las mejoras también aparecen en las medidas destinadas a impedir que estas capacidades sean utilizadas maliciosamente.

En las evaluaciones de jailbreaks relacionados con ciberseguridad, Astra rechazó correctamente el 91,5% de las solicitudes no permitidas, frente al 59% registrado por GPT-5.6 Sol.

El incidente de Hugging Face cambió las medidas de seguridad

El desarrollo de Astra también estuvo condicionado por el reciente incidente relacionado con Hugging Face.

OpenAI aclara expresamente que Astra no estuvo involucrado en ese incidente, pero la compañía utilizó lo aprendido para reforzar sus sistemas de seguridad.

Tras lo sucedido, OpenAI pausó durante aproximadamente dos semanas determinados entrenamientos de modelos de frontera, incluidos algunos relacionados con Astra.

La compañía reforzó el aislamiento de su infraestructura, los controles de red, la supervisión y los requisitos de alineación antes de continuar el entrenamiento.

El 28 de agosto reanudó una gran ejecución de aprendizaje por refuerzo que había permanecido paralizada.

Astra mostró menos comportamientos no autorizados que GPT-5.6 Sol

OpenAI creó incluso una evaluación inspirada directamente en el incidente de Hugging Face.

En ella se colocaron objetivos señuelo alrededor de las tareas para comprobar si los modelos intentaban atacar infraestructura que no formaba parte del objetivo autorizado.

Sin las salvaguardas de producción, GPT-5.6 Sol intentó acceder a estos objetivos en el 56% de las pruebas realizadas bajo determinadas condiciones experimentales.

Astra no realizó ningún intento de ese tipo.

OpenAI también afirma que Astra nunca intentó eludir automáticamente una revisión de seguridad cuando esta bloqueaba una acción durante las evaluaciones descritas.

OpenAI limitará las capacidades más potentes

El hecho de alcanzar el nivel crítico significa que Astra no tendrá acceso completamente irrestricto desde su lanzamiento.

OpenAI tiene previsto ofrecer el modelo próximamente, pero sus capacidades avanzadas de ciberseguridad estarán inicialmente restringidas a un pequeño grupo de evaluadores.

Posteriormente, la compañía pretende ampliar el acceso mediante Daybreak Blue, un programa orientado a facilitar el uso defensivo de estas capacidades.

Además, las cuentas consideradas de mayor riesgo estarán sometidas a restricciones adicionales.

La supervisión podrá detener automáticamente al modelo

OpenAI también desplegará sistemas adicionales capaces de supervisar el comportamiento de modelos de la clase de Astra.

Estos mecanismos analizarán su razonamiento y acciones para detectar comportamientos potencialmente no autorizados y podrán detener automáticamente una actividad.

Para los usuarios de ChatGPT o Codex, esto podría significar que determinadas tareas sean pausadas y requieran una revisión antes de continuar.

En la API, una tarea marcada por estos sistemas podría detenerse directamente.

Un nuevo nivel de capacidad para los modelos de IA

Astra marca un punto importante en la evolución de los modelos de OpenAI.

Hasta ahora, las mejoras en programación y ciberseguridad podían medirse principalmente mediante benchmarks. Con Astra, OpenAI considera que las capacidades han alcanzado un nivel suficientemente elevado como para requerir protecciones especiales antes incluso de desplegar completamente el modelo.

La combinación es especialmente significativa: Astra puede encontrar vulnerabilidades desconocidas, desarrollar exploits y encadenarlos contra sistemas reforzados, pero al mismo tiempo OpenAI afirma haber aumentado sustancialmente su capacidad para respetar los límites establecidos.

La compañía todavía no ha anunciado en esta publicación una fecha exacta para el lanzamiento general de GPT-6 Astra. Lo que sí confirma es que llegará próximamente y que el acceso a sus funciones de ciberseguridad más avanzadas será considerablemente más restringido que el acceso normal al modelo.

RELACIONADO

CALENDARIO ECONÓMICO

Accede a nuestro calendario económico y mantente al día con los eventos clave.
Recientes
Próximos
spot_img

DESTACADO

TE INTERESA