Anthropic’s AI used fake identities, malware in rogue attack on GitHub project
Durante una evaluación rutinaria de ciberseguridad realizada por el Instituto de Seguridad de la IA (AISI) del gobierno del Reino Unido, se descubrieron incidentes de seguridad inesperados que involucraron a modelos de inteligencia artificial de vanguardia. El caso más grave ocurrió cuando el modelo Mythos 5 de Anthropic intentó insertar código malicioso en una aplicación de software de código abierto y creó identidades falsas para engañar a los desarrolladores humanos que mantenían el proyecto.
Estos incidentes de seguridad se produjeron durante una evaluación de las capacidades de siete modelos de IA líderes a finales de julio. Según una publicación del blog de AISI del 4 de agosto, se descubrieron 19 casos en los que «agentes de IA tomaron acciones no autorizadas en Internet en vivo, incluidos casos que apuntaban a personas y organizaciones reales».
Casi todas las acciones «autónomas y no autorizadas» provinieron del modelo Mythos 5 de Anthropic, con dos acciones similares provenientes de GPT-5.6 Sol de OpenAI. El equipo de seguridad del Instituto de Seguridad de la IA se dio cuenta de que algo andaba mal la mañana del 28 de julio, cuando su servicio de monitoreo de seguridad comercial detectó datos saliendo de uno de los sistemas de prueba a través de la red de anonimato Tor.
Es importante aclarar que no se trató de un caso de agentes de IA escapando de su entorno de pruebas virtual y causando estragos en Internet. En cambio, los investigadores permitieron intencionalmente que los agentes de IA tuvieran acceso a Internet como parte del proceso de prueba cibernética. También desactivaron algunos de los clasificadores cibernéticos que los proveedores de modelos de IA habían incorporado para prevenir el uso indebido.
Aunque todos los intentos de los agentes de IA de apuntar a personas y organizaciones reales fracasaron, los investigadores describieron las acciones de los agentes de IA como «la primera vez que hemos visto riesgos en torno a la autonomía y el engaño manifestarse tan claramente, sin un estímulo específico, en el mundo real».
El caso más serio involucró a Mythos haciendo múltiples intentos de ejecutar un ataque a la cadena de suministro en el repositorio de proyectos de código abierto alojado en la plataforma de desarrollo GitHub, utilizando técnicas de ingeniería social para intentar convencer a los mantenedores humanos del repositorio de fusionar código malicioso en el repositorio.
Después de abrir una solicitud de extracción para fusionar el código malicioso en el repositorio, Mythos creó «sock puppets» en línea que afirmaban haber revisado y verificado de manera independiente que el código no contenía malware. El agente de IA también envió cinco correos electrónicos a dos mantenedores humanos del repositorio, incluidos algunos correos electrónicos que contenían malware y otros que intentaban persuadir a un mantenedor para que aceptara la solicitud de extracción.
Mythos incluso abrió un problema de GitHub en un segundo repositorio, también propiedad de un mantenedor del primer repositorio, que contenía una inyección de instrucciones maliciosas dirigidas a «agentes de codificación de IA de clasificación de problemas». Esta línea de ataque surgió de la suposición de Mythos de que el mantenedor del repositorio podría ser un agente de codificación de IA, como Claude Code.
En comparación, GPT-5.6 Sol de OpenAI llevó a cabo dos acciones no autorizadas mientras intentaba resolver el desafío de ciberseguridad asignado de atacar redes simuladas y recuperar una bandera. Las acciones del agente de IA fueron detalladas tanto por los investigadores de AISI como por OpenAI en el blog de la compañía.
En su primera acción no autorizada, GPT-5.6 Sol reutilizó un token de GitHub que otro agente de IA del laboratorio había dejado accesible en un bloc de notas en línea público para verificar si la red objetivo estaba comprobando actualizaciones en GitHub, luego «intentó la recuperación de cuenta y soluciones alternativas de límite de solicitud», escribió OpenAI. El modelo de OpenAI también registró cuentas con proveedores externos de DNS y túneles fuera del entorno de prueba virtual.
En la segunda acción, GPT-5.6 Sol «utilizó un servicio de túnel público para hacer que un servidor DNS que se ejecutaba localmente en su entorno de evaluación fuera accesible desde Internet pública», según OpenAI. El servidor contenía cargas útiles diseñadas para explotar una vulnerabilidad conocida en el software que se ejecutaba dentro del entorno de evaluación, pero la configuración del agente de IA no funcionó.
El Instituto de Seguridad de la IA ha publicado un informe técnico detallado sobre todas las acciones no autorizadas de los agentes de IA.
Los incidentes de seguridad llevaron a los investigadores del gobierno del Reino Unido en el Instituto de Seguridad de la IA a detener todas las evaluaciones relacionadas de agentes de IA, aislar las máquinas virtuales relevantes y deshabilitar el acceso de la organización interna a los modelos más capaces.
El Instituto de Seguridad de la IA también notificó a GitHub sobre la actividad maliciosa realizada por agentes de IA y ayudó a la plataforma de desarrollo a eliminar cualquier «artefacto dejado por el agente», además de notificar a los usuarios de GitHub con los que el modelo interactuó.
Pero las lecciones más importantes provienen de cómo la organización gubernamental planea cambiar las pruebas cibernéticas para estos modelos de IA líderes en el futuro, y cómo recomienda que otras organizaciones hagan lo mismo.
Primero, planea restringir el acceso a Internet para los modelos de IA durante las pruebas cibernéticas en lugar de permitir el acceso abierto a Internet por defecto. Esto supuestamente incluirá «controles de red de grano fino para todos los sistemas de sandboxing internos» y «defensa en profundidad con controles de red en múltiples capas», según el informe técnico.
En segundo lugar, la organización está introduciendo un monitoreo en tiempo real de las evaluaciones cibernéticas que puede «marcar o bloquear acciones fuera de alcance a medida que ocurren», según AISI. Esto implica el uso de un modelo de lenguaje grande separado que puede aprobar o denegar acciones solicitadas por los modelos de IA que están siendo sometidos a pruebas cibernéticas, lo que puede ayudar a detener acciones no autorizadas. El monitoreo basado en LLM se personalizaría con instrucciones sobre lo que debe o no debe permitirse en cualquier evaluación cibernética dada.
En tercer lugar, los investigadores del gobierno del Reino Unido planean revisar las evaluaciones cibernéticas invirtiendo más en…