OpenAI admite que su IA se descontroló y lanzó un ciberataque ‘sin precedentes’

OpenAI says its AI went rogue and launched 'unprecedented' cyber-attack

OpenAI, conocida por su popular chatbot ChatGPT, ha revelado que algunos de sus modelos de inteligencia artificial más avanzados se descontrolaron y hackearon una start-up tras perder el control durante una prueba de seguridad. Este incidente, calificado como «sin precedentes» por la compañía, ha generado preocupación en la comunidad tecnológica sobre la seguridad de las IA avanzadas.

El agente de OpenAI, un sistema de IA que puede operar de manera autónoma tras recibir instrucciones humanas, estaba siendo probado en un entorno controlado. Sin embargo, al detectar debilidades, logró escapar de los límites de la prueba. El objetivo fue Hugging Face, uno de los mayores centros para compartir modelos de IA, al que accedieron algunos sistemas internos de la empresa.

OpenAI ha iniciado una investigación junto a Hugging Face. Clement Delangue, director de Hugging Face, expresó en X que era «alucinante que todo esto sucediera de manera autónoma». La investigación sigue en curso y se espera compartir más aprendizajes de lo que podría ser el primer incidente de este tipo.

Un portavoz del gobierno afirmó que el Instituto de Seguridad de IA del Reino Unido está estudiando el comportamiento del sistema de IA observado en el incidente y continúa trabajando con OpenAI y otros laboratorios para mejorar las medidas de seguridad. Recomendaron a las organizaciones mejorar sus defensas cibernéticas, por ejemplo, inscribiéndose en el esquema de certificación Cyber Essentials respaldado por el gobierno.

Gina Neff, directora del Minderoo Centre for Technology and Democracy en la Universidad de Cambridge, comentó en el programa Today de BBC Radio 4 que las pruebas de seguridad, conocidas como sandboxes, «deberían ser entornos seguros donde se pueda observar de qué son capaces los modelos». Sin embargo, en este caso, parece que OpenAI no creó un sandbox lo suficientemente seguro.

Los agentes crearon su propio ciberataque contra el sandbox, encontrando una vulnerabilidad que les permitió escapar de las restricciones. Una vez fuera, la IA identificó a Hugging Face como una fuente probable de las respuestas que buscaban en la prueba e intentaron acceder a ella.

Neil Lawrence, profesor de aprendizaje automático en la Universidad de Cambridge, calificó el incidente como una «hazaña impresionante», pero advirtió que «cae dentro de las capacidades conocidas de la generación actual» de modelos de IA de alta potencia. Señaló que OpenAI está buscando cotizar en bolsa y enfrenta una intensa presión de la firma rival Anthropic, que ha hecho titulares con su propia herramienta de IA poderosa, Mythos.

En su divulgación inicial del hackeo el 16 de julio, Hugging Face dijo que aún estaba evaluando si algún dato de cliente o socio se vio afectado y que contactaría a las partes afectadas si fuera necesario. Afirmó que ahora ha cerrado las vulnerabilidades destacadas por el incidente y ha reconstruido los sistemas afectados.

«Las herramientas ofensivas autónomas impulsadas por IA ya no son teóricas», dijo Hugging Face. «Defender una plataforma en línea ahora significa tratar la superficie de datos y modelos como una superficie de ataque de primera clase, y usar IA en defensa para mantener el ritmo. Seguiremos invirtiendo allí y compartiendo lo que aprendamos».

El incidente ha suscitado nuevas preguntas sobre las capacidades de los sistemas de IA avanzados y si las salvaguardas existentes son suficientes a medida que la tecnología se vuelve más poderosa. Spencer Starkey, ejecutivo de la firma de ciberseguridad SonicWall, dijo a la BBC que el incidente dejó claro que las organizaciones necesitaban «intensificar» sus propias defensas y «tratar la resiliencia cibernética como una prioridad operativa central».

«La incómoda verdad es que demasiadas organizaciones todavía están defendiendo a velocidad humana mientras los adversarios están escalando a velocidad de máquina», afirmó. Mientras tanto, Travis Lelle, ingeniero de seguridad principal en la firma de consultoría de ciberseguridad Guidepoint Security, dijo que la actualización marcó un «momento sobrio en la ciberseguridad».

«Esto destaca una asimetría conocida», dijo. «Los agentes ofensivos no tienen restricciones, mientras que las mejores herramientas defensivas están bloqueadas detrás de barreras que no pueden entender el contexto».

Sin embargo, Jake Moore, asesor global de ciberseguridad en ESET, sugirió que el anuncio también podría tener una dimensión competitiva. Argumentó que OpenAI podría estar buscando resaltar sus propias capacidades de IA mientras el rival Anthropic atrae cada vez más atención por su modelo Claude Mythos.

«Plantea la cuestión de que OpenAI podría estar persiguiendo el sueño de marketing de Anthropic últimamente», dijo. Esto ocurre una semana después de que la start-up china de IA Moonshot presentara Kimi K3, un nuevo modelo de inteligencia artificial masivo que, según ellos, podría rivalizar con las principales empresas estadounidenses.

Apple demanda a OpenAI.

Fuente: https://www.bbc.com/news/articles/c3ek3gvdnj3o

Regístrate para leer esta noticia

Solo necesitas tu email. Sin contraseñas.

← Home