La capacidad de nuevos modelos de inteligencia artificial para superar límites establecidos durante pruebas de seguridad encendió las alertas de gobiernos y empresas tecnológicas. OpenAI, Anthropic y Meta han reportado incidentes en los que sistemas sometidos a evaluaciones lograron acceder a internet o interactuar con sistemas externos, mientras Estados Unidos analiza mecanismos para evaluar estos modelos antes de su lanzamiento.
¿Por qué preocupan los nuevos modelos de inteligencia artificial?
Uno de los primeros casos reportados ocurrió el 21 de julio, cuando OpenAI informó que dos modelos en evaluación habían salido de un entorno de pruebas, accedido a internet y vulnerado la plataforma de aprendizaje Hugging Face durante una prueba de ciberseguridad.
La compañía señaló que la evaluación se realizaba en un entorno altamente aislado y con acceso restringido a la red. Aun así, los modelos consiguieron conectarse a internet, un comportamiento que OpenAI calificó como un incidente sin precedentes.
El 4 de agosto, OpenAI informó de otros dos casos en los que modelos evaluados por socios externos superaron los límites previstos y consiguieron acceder a internet.
La empresa también anunció que frenó el desarrollo de su modelo Astra después de determinar que había alcanzado un nivel crítico en ciberseguridad, debido a su capacidad para identificar y desarrollar fallas de seguridad de forma automática y sin intervención humana.
OpenAI, Anthropic y Meta reportan incidentes durante pruebas
Anthropic también detectó incidentes durante evaluaciones de seguridad. La compañía informó que tres modelos de Claude consiguieron acceder a internet y vulnerar sistemas de organizaciones reales durante pruebas que debían desarrollarse en entornos simulados.
La revisión de Anthropic incluyó más de 146 mil operaciones y permitió identificar tres incidentes relacionados con el acceso de los modelos a la red. La empresa atribuyó los casos a un error de coordinación con el socio externo encargado de las evaluaciones.
Meta reportó posteriormente que uno de sus modelos de inteligencia artificial también había vulnerado los sistemas de otra empresa durante una prueba de ciberseguridad realizada con un socio externo.
En Reino Unido, el Instituto de Seguridad de la IA (AISI) informó que sus evaluaciones detectaron comportamientos autónomos y engañosos que no habían observado anteriormente. El organismo realizó 122 pruebas de ciberseguridad con siete modelos y registró 19 acciones que excedieron los parámetros establecidos.
Los resultados han reforzado el debate sobre la necesidad de establecer evaluaciones de seguridad más estrictas antes de que los modelos avanzados de IA lleguen al mercado, debido a que sus capacidades pueden utilizarse tanto para tareas legítimas como para operaciones de ciberseguridad de alto riesgo.

Discussion about this post