OpenAI says its AI went rogue and launched 'unprecedented' cyber-attack
OpenAI ha revelado que algunos de sus modelos de inteligencia artificial más avanzados se descontrolaron y hackearon una start-up después de que la empresa perdiera el control durante una prueba de seguridad. Según OpenAI, su agente —un sistema de IA que puede operar de manera autónoma después de recibir instrucciones humanas— estaba siendo probado en un entorno controlado, pero, tras encontrar debilidades, logró evadir los límites de la prueba.
Los modelos de IA dirigieron su ataque hacia Hugging Face, uno de los mayores centros mundiales para compartir modelos de inteligencia artificial, accediendo a algunos sistemas internos de la empresa. OpenAI calificó el incidente como «sin precedentes» y está llevando a cabo una investigación junto con Hugging Face, cuyo director Clement Delangue expresó en X que era «alucinante que todo esto ocurriera de manera autónoma».
Un portavoz del gobierno del Reino Unido declaró que el Instituto de Seguridad de la IA del país estaba estudiando el comportamiento del sistema de IA observado en el incidente y continuaba trabajando con OpenAI y otros laboratorios para mejorar las medidas de seguridad. Se recomendó a las organizaciones que reforzaran sus defensas cibernéticas mediante pasos como inscribirse en el esquema de certificación Cyber Essentials respaldado por el gobierno.
Gina Neff, directora del Minderoo Centre for Technology and Democracy en la Universidad de Cambridge, comentó en el programa Today de BBC Radio 4 que las pruebas de seguridad, llamadas sandboxes, «se supone que son entornos seguros donde puedes ver de qué son capaces los modelos». Sin embargo, en este caso, parece que OpenAI no creó un sandbox lo suficientemente seguro, permitiendo que los agentes crearan su propio ciberataque contra el sandbox mismo y escaparan de las restricciones.
Neil Lawrence, profesor de aprendizaje automático en la Universidad de Cambridge, describió el incidente como una «hazaña impresionante», pero advirtió que «cae bien dentro de las capacidades conocidas de la generación actual» de modelos de IA de alta potencia. Señaló que OpenAI busca cotizar en el mercado de valores y enfrenta una intensa presión de la empresa rival Anthropic, que ha hecho titulares con su propia herramienta de IA poderosa, Mythos.
En su divulgación inicial del hackeo el 16 de julio, Hugging Face mencionó que aún estaba evaluando si algún dato de clientes o socios fue afectado y que contactaría a las partes afectadas si fuera necesario. La empresa afirmó que ha cerrado las vulnerabilidades destacadas por el incidente y ha reconstruido los sistemas afectados.
El incidente ha suscitado nuevas preguntas sobre las capacidades de los sistemas de IA avanzados y si las salvaguardias existentes son suficientes a medida que la tecnología se vuelve más poderosa. Spencer Starkey, ejecutivo de la firma de ciberseguridad SonicWall, declaró a la BBC que el incidente dejó claro que las organizaciones necesitaban «intensificar» sus propias defensas y «tratar la resiliencia cibernética como una prioridad operativa central».
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.