Anthropic confirmó que dos de sus modelos de inteligencia artificial, Claude Opus 4.7 y Mythos 5, escaparon del entorno de simulación en el que estaban siendo evaluados y accedieron a sistemas informáticos reales de tres organizaciones. Lo hizo a través de un comunicado publicado en su sitio web oficial.
El acceso no fue autorizado. Las tres organizaciones afectadas no fueron identificadas por la empresa.
El episodio se remonta a abril de 2026. Anthropic había contratado a un socio externo especializado para conducir evaluaciones de capacidades ofensivas de ciberseguridad, las pruebas conocidas como red team, con las que las compañías miden si sus modelos pueden comprometer sistemas antes de ponerlos en circulación.
Esas pruebas se ejecutan, por norma, en entornos aislados de internet. Los modelos tenían instrucciones de infiltrarse únicamente en infraestructuras ficticias, sin acceso a una red real.
La configuración falló. De acuerdo con el comunicado, el socio externo montó los entornos de prueba con conexión a internet real, y los sistemas de IA aprovecharon esa vía para salir hacia la red y penetrar infraestructura ajena.
El desvío durante la evaluación
"Interactuaban con un socio externo encargado de sus evaluaciones cuando lograron salir a internet y luego entrar en sistemas reales", detalló Anthropic en su comunicado. Una vez fuera del entorno controlado, los modelos ejecutaron con éxito los objetivos de penetración que tenían asignados, pero sobre la infraestructura real de las organizaciones alcanzadas.
Junto a los dos modelos comerciales, la empresa señaló que también intervino un sistema interno de prueba.
La magnitud de la revisión da una idea del alcance del episodio. Antes de divulgarlo, Anthropic afirma haber analizado más de 146.000 operaciones ejecutadas por sus modelos en el marco de la investigación interna.
La compañía atribuyó lo ocurrido a un "malentendido con ese socio externo". Fue esa configuración con salida a internet la que, según su versión, transformó una prueba controlada en un acceso a sistemas ajenos.