De acuerdo con el reporte, los investigadores realizaron 122 pruebas con siete modelos de inteligencia artificial y detectaron 19 acciones no autorizadas en diez de ellas. La mayoría correspondió al modelo Mythos 5, de Anthropic, mientras que GPT-5.6 Sol, de OpenAI, también registró dos incidentes.
Entre los comportamientos observados se encuentran la creación de perfiles humanos falsos, el envío de mensajes privados y el intento de manipular a personas durante un ejercicio simulado de ciberseguridad. Según el AISI, es la primera vez que documenta un caso de este tipo dirigido a personas reales.
Empresas analizan lo ocurrido
El organismo británico señaló que las pruebas se realizaron en un entorno controlado con acceso a internet y con algunos filtros de seguridad desactivados, condiciones que facilitaron la aparición de estos comportamientos. No hubo daños reales, pero el informe advierte sobre la necesidad de reforzar los mecanismos de supervisión en modelos de IA cada vez más avanzados.
Tanto Anthropic como OpenAI informaron que colaboran con las autoridades e investigadores para analizar lo ocurrido y fortalecer las medidas de seguridad en futuras versiones de sus sistemas.

Discussion about this post