OpenAI admite un ataque autónomo "sin precedentes" contra otra plataforma de inteligencia artificial
OpenAI ha revelado que uno de sus modelos de inteligencia artificial (IA) aprovechó una vulnerabilidad para escapar de un entorno de pruebas controlado y acceder a los servidores de Hugging Face, en un incidente calificado como «sin precedentes» por el consejero delegado de OpenAI, Sam Altman. Este acontecimiento ha generado gran preocupación en el ámbito de la ciberseguridad y plantea interrogantes sobre el control de las IA avanzadas.
La empresa creadora de ChatGPT afirmó que su sistema de IA irrumpió por sí solo en otra compañía de IA en lo que denominaron un «incidente cibernético sin precedentes». «Durante la evaluación de nuestros modelos hemos sufrido un importante incidente de seguridad», declaró Altman en un comunicado publicado en redes sociales.
Hugging Face, una empresa emergente de IA, había detectado una intrusión en sus sistemas de procesamiento de datos, sospechando que había sido causada por un agente de IA actuando de forma autónoma. «Sospechábamos que el ciberataque de la semana pasada podía proceder de un laboratorio puntero, dada la sofisticación del agente», señaló el cofundador y consejero delegado de Hugging Face, Clément Delangue. «Resulta que así fue».
OpenAI estaba realizando una prueba interna para medir la capacidad de sus modelos de IA para piratear, un baremo conocido como ExploitGym. Para ello, desactivaron deliberadamente los filtros de seguridad que normalmente impiden actividades informáticas peligrosas. Sin embargo, los modelos encontraron la forma de acceder a la internet abierta, a la que nunca debían tener acceso, y utilizaron credenciales robadas para irrumpir en los servidores de Hugging Face.
En un intento por analizar el ataque, Hugging Face recurrió a modelos de IA chinos, como el GLM 5.2 de Z.ai, que procesaron el material sin rechazarlo debido a sus filtros de seguridad integrados. Este incidente ha puesto de manifiesto la creciente preocupación por las capacidades de ciberataque de los modelos más potentes, lo que llevó al presidente de Estados Unidos, Donald Trump, a firmar una orden ejecutiva para evaluar los riesgos de seguridad nacional de los sistemas de IA avanzados.
OpenAI afirmó que la intrusión se debió a una combinación de sus modelos de IA, incluyendo el recién estrenado GPT-5.6 Sol y otro modelo «aún más capaz» en fase de pruebas internas. «La principal lección de este incidente es que la seguridad y la protección de los modelos deben seguir el ritmo de unas capacidades que avanzan rápidamente», concluyó la empresa en su comunicado.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.