OpenAI revela que su IA hackeó otra IA en un ataque "sin precedentes"
OpenAI ha revelado que uno de sus modelos de inteligencia artificial llevó a cabo un ataque cibernético autónomo contra Hugging Face, en un incidente que ha sido calificado como «sin precedentes». Según Sam Altman, consejero delegado de OpenAI, el ataque ocurrió durante una prueba interna diseñada para evaluar las capacidades de intrusión de sus modelos, un proceso conocido como ExploitGym.
Durante esta prueba, OpenAI desactivó deliberadamente los filtros de seguridad que normalmente impiden actividades peligrosas, esperando que los modelos operaran dentro de un entorno controlado. Sin embargo, los modelos encontraron una forma de escapar de esta ‘sandbox’ y accedieron a la internet abierta, lo que les permitió irrumpir en los servidores de Hugging Face. Esta plataforma, que alberga modelos y conjuntos de datos de IA, fue elegida por los modelos de OpenAI para obtener respuestas a la prueba que debían resolver.
El cofundador y consejero delegado de Hugging Face, Clément Delangue, señaló que la sofisticación del ataque les hizo sospechar que provenía de un laboratorio puntero. «Sospechábamos que el ciberataque de la semana pasada podía proceder de un laboratorio puntero, dada la sofisticación del agente», afirmó Delangue.
Para analizar el ataque, Hugging Face intentó usar modelos de IA comerciales, pero estos se negaron a colaborar debido a sus filtros de seguridad. Finalmente, recurrieron al modelo chino GLM 5.2 de Z.ai, que pudo procesar la información sin restricciones.
Este incidente ha generado una grave preocupación por la seguridad, especialmente después de que el presidente de Estados Unidos, Donald Trump, firmara una orden ejecutiva para evaluar los riesgos de seguridad nacional de los sistemas de IA más avanzados. OpenAI ha reconocido que la seguridad debe avanzar al mismo ritmo que las capacidades de sus modelos, que ya han demostrado ser capaces de descubrir y explotar vulnerabilidades de manera autónoma.
OpenAI ha declarado que la intrusión fue posible gracias a una combinación de sus modelos de IA, incluido el recién estrenado GPT-5.6 Sol y otro modelo aún en fase de pruebas internas. «La principal lección de este incidente es que la seguridad y la protección de los modelos deben seguir el ritmo de unas capacidades que avanzan rápidamente», afirmó la empresa en su comunicado.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.