Siguenos en

Anthropic incorpora a Accenture como evaluador independiente y destina miles de millones a reforzar la seguridad de la IA

·
·

Anthropic ha elegido a Accenture como su primer evaluador integrado para someter sus modelos de inteligencia artificial a pruebas independientes de seguridad, alineación y red teaming. La iniciativa forma parte de la propuesta de Dario Amodei para reducir el ritmo de avance de la IA de frontera y permitirá a evaluadores externos acceder a los modelos de una forma mucho más profunda que mediante las pruebas convencionales.


Anthropic empieza a ejecutar su plan para ralentizar la IA

Anthropic está convirtiendo en medidas concretas la propuesta presentada recientemente por su CEO, Dario Amodei, para reducir los riesgos asociados al rápido desarrollo de sistemas de inteligencia artificial cada vez más capaces.

La compañía ha seleccionado a Accenture como su primer evaluador integrado, una nueva figura diseñada para proporcionar evaluaciones independientes mucho más profundas de sus modelos.

La colaboración permitirá realizar pruebas de seguridad, ejercicios de red teaming, evaluaciones de alineación y análisis de las salvaguardas incorporadas en los sistemas de Anthropic.

La alianza no será exclusiva.

Anthropic anticipa incorporar otros evaluadores durante las próximas semanas.

¿Qué significa ser un “evaluador integrado”?

La diferencia fundamental está en el nivel de acceso.

Tradicionalmente, investigadores externos pueden evaluar un modelo mediante interfaces, versiones preliminares o sistemas proporcionados específicamente para realizar pruebas.

Anthropic quiere ir más lejos.

La propuesta de Amodei contempla proporcionar a evaluadores independientes un nivel de acceso mucho más cercano al disponible para los propios empleados de los laboratorios de IA.

El objetivo es permitir que especialistas externos puedan detectar vulnerabilidades y comportamientos peligrosos antes de que los modelos más avanzados sean desplegados ampliamente.

Accenture someterá los modelos a red teaming

Una de las funciones será realizar pruebas conocidas como red teaming.

En este tipo de evaluaciones, especialistas intentan deliberadamente encontrar maneras de provocar comportamientos problemáticos en un sistema.

Esto puede incluir descubrir vulnerabilidades, intentar superar salvaguardas o identificar situaciones en las que el modelo se comporte de manera diferente a la prevista por sus desarrolladores.

En lugar de comprobar únicamente que el sistema funciona correctamente, los evaluadores intentan encontrar activamente las condiciones bajo las que puede fallar.

También se evaluará la alineación

Otra parte importante estará relacionada con las evaluaciones de alineación.

Estas pruebas buscan analizar si el comportamiento de modelos avanzados continúa respondiendo a los objetivos, restricciones y salvaguardas definidos durante su desarrollo.

A medida que aumenta la capacidad de los sistemas, Anthropic considera que estos mecanismos deben evolucionar simultáneamente.

La compañía quiere que parte de esa evaluación sea realizada por organizaciones externas y no exclusivamente por sus propios equipos.

Faculty participará en las pruebas

La iniciativa contará también con Faculty, la división especializada en inteligencia artificial de Accenture.

Faculty tiene experiencia desarrollando y evaluando sistemas avanzados de IA.

Su participación estará orientada a construir metodologías para evaluar modelos de frontera, probar sus mecanismos de seguridad y analizar posibles comportamientos problemáticos.

La propia Anthropic reconoce que el concepto de evaluación integrada todavía está en una etapa temprana.

Eso significa que parte de la colaboración consistirá precisamente en determinar cómo debe funcionar este nuevo modelo de supervisión.

Anthropic y Accenture comprometen una inversión multimillonaria

La escala económica de la alianza también resulta considerable.

Según el anuncio, Anthropic y Accenture prevén invertir cada una al menos $1.000 millones durante los próximos cinco años en el proyecto.

En conjunto, esto implica un compromiso mínimo de aproximadamente $2.000 millones si ambas partes cumplen las cantidades anunciadas.

La inversión muestra que la evaluación de seguridad empieza a convertirse en una infraestructura propia dentro del desarrollo de IA avanzada.

Ya no se trata únicamente de entrenar modelos más grandes.

También será necesario construir sistemas capaces de comprobar qué pueden hacer esos modelos antes de desplegarlos.

Anthropic financiará directamente las evaluaciones

Existe, sin embargo, un problema estructural.

Todavía no existe un mecanismo ampliamente establecido para financiar evaluaciones externas de modelos de frontera.

Anthropic considera que, a largo plazo, estas actividades podrían financiarse mediante fondos compartidos entre diferentes compañías o recursos gubernamentales.

Pero la compañía no quiere esperar a que aparezca ese sistema.

Debido a la urgencia que atribuye al problema, financiará directamente el trabajo realizado por Accenture.

La independencia será una cuestión fundamental

Este modelo introduce una cuestión importante.

Un evaluador externo puede aportar una perspectiva independiente, pero si su trabajo está financiado directamente por la compañía cuyos modelos está evaluando, será importante establecer mecanismos que preserven su autonomía.

Metodologías transparentes, capacidad para comunicar resultados adversos y separación entre equipos pueden convertirse en elementos importantes del modelo.

Anthropic sostiene que precisamente quiere crear un sistema en el que evaluadores externos tengan suficiente acceso para realizar pruebas significativas.

Dario Amodei quiere reducir el ritmo de la carrera de la IA

La alianza aparece después de que Amodei presentara el 12 de septiembre una propuesta para controlar el ritmo de desarrollo de los modelos de frontera.

Su preocupación se centra especialmente en la velocidad con la que las capacidades están aumentando.

Amodei considera que la industria podría aproximarse a una etapa en la que los propios sistemas de inteligencia artificial contribuyan significativamente al desarrollo de generaciones posteriores de IA.

Este fenómeno suele denominarse automejora recursiva.

¿Qué es la automejora recursiva?

El concepto describe una dinámica en la que un sistema de inteligencia artificial ayuda a mejorar las herramientas utilizadas para desarrollar modelos posteriores.

Por ejemplo, una IA suficientemente avanzada podría ayudar a escribir código, diseñar arquitecturas, optimizar procesos de entrenamiento o realizar investigación científica relacionada con nuevos sistemas.

Si cada generación contribuye a desarrollar más rápidamente la siguiente, el ritmo de progreso podría acelerarse.

Amodei argumenta que un escenario de este tipo podría reducir el tiempo disponible para comprender y controlar sistemas cada vez más potentes.

Se trata de una hipótesis sobre la evolución futura de la tecnología, no de una demostración de que ese proceso esté ocurriendo inevitablemente.

La propuesta busca crear tiempo para desarrollar salvaguardas

El objetivo de Anthropic no consiste simplemente en detener el desarrollo de inteligencia artificial.

La propuesta pretende acompasar el aumento de capacidades con la evolución de las herramientas utilizadas para evaluar y controlar los modelos.

La idea central es que la capacidad de supervisión debería avanzar a un ritmo comparable al de la capacidad tecnológica.

Los evaluadores integrados constituyen una de las primeras piezas de esa estrategia.

Sam Altman y Elon Musk respaldaron la idea

La propuesta generó rápidamente reacciones entre algunos de los principales ejecutivos tecnológicos.

El CEO de OpenAI, Sam Altman, reaccionó positivamente a la iniciativa de Amodei.

Elon Musk, CEO de SpaceX y fundador de xAI, también expresó una respuesta favorable.

La coincidencia resulta significativa porque los grandes laboratorios compiten directamente por desarrollar algunos de los modelos de IA más avanzados.

Pero no existe consenso completo dentro de la industria.

Jensen Huang rechaza la necesidad de frenar la IA

El CEO de Nvidia, Jensen Huang, expresó una posición diferente.

Huang cuestionó la necesidad de introducir un mecanismo destinado a ralentizar el desarrollo tecnológico y defendió una aproximación diferente a la regulación.

La divergencia muestra uno de los grandes debates que empieza a aparecer dentro del sector.

Una parte de la industria considera que el crecimiento de las capacidades exige nuevas restricciones y mecanismos de evaluación.

Otra sostiene que ralentizar el desarrollo puede limitar la innovación sin garantizar necesariamente mejores resultados de seguridad.

La carrera de la IA entra en una nueva fase

Hasta ahora, buena parte de la competencia se ha concentrado en potencia computacional, modelos, parámetros, razonamiento, agentes y capacidad multimodal.

La seguridad puede convertirse ahora en otra dimensión competitiva.

Los laboratorios tendrán que demostrar no solo que sus modelos son más capaces, sino también que pueden evaluarlos, controlarlos y desplegarlos de manera fiable.

Esto puede generar una nueva industria alrededor de auditorías y pruebas independientes de inteligencia artificial.

Anthropic no quiere depender de un único evaluador

La compañía también ha dejado claro que Accenture será únicamente el primero.

Anthropic espera anunciar nuevas organizaciones evaluadoras durante las próximas semanas.

Un sistema con diferentes evaluadores puede reducir la dependencia de una única metodología.

También permitiría comparar resultados y aumentar las posibilidades de descubrir problemas que un solo equipo podría pasar por alto.

La evaluación externa puede convertirse en un estándar

Si el modelo funciona, podría extenderse más allá de Anthropic.

Los grandes laboratorios podrían terminar sometiendo sus modelos más avanzados a pruebas externas antes de determinados despliegues.

Gobiernos y reguladores también podrían utilizar evaluaciones independientes como parte de futuros marcos de supervisión.

En ese escenario, organizaciones especializadas en evaluar modelos podrían desempeñar un papel parecido al de auditores, laboratorios de pruebas o firmas de ciberseguridad en otras industrias.

La cuestión clave será cuánto acceso reciben realmente

La efectividad del proyecto dependerá finalmente de su implementación.

Para detectar determinados problemas, un evaluador necesita tiempo, herramientas, conocimiento técnico y acceso suficiente al sistema.

Anthropic sostiene que su modelo pretende aproximar ese acceso al que reciben sus propios empleados.

Si esto se materializa, representaría una diferencia considerable frente a las auditorías externas más limitadas.

También aumentaría las exigencias de confidencialidad y seguridad, ya que los evaluadores podrían acceder a información sensible sobre algunos de los modelos comerciales más avanzados.

Anthropic convierte la seguridad en una inversión estratégica

La alianza con Accenture representa algo más que una auditoría puntual.

Con un compromiso conjunto mínimo de aproximadamente $2.000 millones durante cinco años, Anthropic está intentando construir una infraestructura permanente de evaluación alrededor de sus modelos.

El movimiento llega apenas días después de que Amodei pidiera reducir el ritmo de la carrera de la inteligencia artificial para permitir que las herramientas de seguridad puedan evolucionar.

Ahora la compañía comienza a implementar la primera parte de ese plan.

Accenture será el primer evaluador integrado, pero no el único.

Si Anthropic cumple su calendario, durante las próximas semanas deberían conocerse nuevos participantes.

La gran pregunta será si esta estructura permanece como una iniciativa voluntaria de Anthropic o termina convirtiéndose en un nuevo estándar para evaluar los modelos de inteligencia artificial de frontera antes de su despliegue.

RELACIONADO

CALENDARIO ECONÓMICO

Accede a nuestro calendario económico y mantente al día con los eventos clave.
Recientes
Próximos
spot_img

DESTACADO

TE INTERESA