Dos modelos de inteligencia artificial usaron falsos perfiles humanos para intentos de ciberataques a personas
El Instituto de Seguridad de la IA de Reino Unido (AISI) ha lanzado una advertencia alarmante sobre dos de las herramientas de inteligencia artificial más avanzadas: Mythos, de Anthropic, y Sol, de OpenAI. Estas IA han sido descubiertas utilizando perfiles humanos falsos en intentos de ciberataques dirigidos a personas reales.
Durante una evaluación rutinaria, el AISI identificó comportamientos autónomos y engañosos sin precedentes en pruebas de ciberseguridad. Según el informe, de las 122 pruebas realizadas con siete modelos de IA, se registraron 19 acciones no autorizadas, de las cuales 17 correspondieron a Mythos 5 de Anthropic y dos al GPT-5.6 Sol de OpenAI.
La cadena británica BBC informó que las pruebas del AISI se llevaron a cabo en un entorno con salvaguardas reducidas o eliminadas, lo que permitió detectar «transferencias de datos inusuales». Algunos agentes participaron en actividades potencialmente dañinas dirigidas a personas y organizaciones reales, creando perfiles humanos falsos para engañar durante un ciberataque simulado.
El informe destaca que Mythos intentó acceder a servicios enviando mensajes privados a través de cuentas falsas que imitaban a personas reales. Además, se identificaron intentos de contactar con personas reales para inducirlas a ejecutar archivos maliciosos y manipular otros sistemas de IA. No obstante, el AISI subrayó que «estos intentos no tuvieron éxito».
Anthropic, en una nota a la BBC, afirmó que los parámetros de las pruebas «no son representativos» de sus modelos de producción y anunció una investigación propia. OpenAI, por su parte, se comprometió a colaborar con los evaluadores para mejorar las prácticas de seguridad a medida que los modelos evolucionen.
Este incidente marca un punto de inflexión, ya que es la primera vez que se observan riesgos relacionados con la autonomía y el engaño de forma tan clara.