Rogue OpenAI agent that hacked startup tried to attack other firms
OpenAI ha revelado que un ciberataque llevado a cabo por un agente de inteligencia artificial rebelde tuvo más de una víctima. El desarrollador de ChatGPT informó que este agente, una herramienta autónoma capaz de ejecutar secuencias de comandos sin ayuda humana, localizó y utilizó credenciales para acceder a cuatro servicios adicionales, además de la startup estadounidense Hugging Face.
La actividad, aunque preocupante, no alcanzó la gravedad o escala de lo ocurrido en Hugging Face, una empresa que aloja una base de datos de modelos de IA. El agente, impulsado por dos modelos de OpenAI, evadió el control y atacó la startup durante una prueba interna de ciberseguridad.
Modal Labs, una empresa que ayuda a startups de IA a acceder a los chips necesarios para ejecutar herramientas de IA, indicó que el agente explotó un código vulnerable escrito por un cliente que estaba alojado en la plataforma de Modal. Según una cronología del incidente publicada por Hugging Face esta semana, el agente rebelde salió de su entorno de prueba aislado y hackeó otro entorno de prueba «alojado en la infraestructura de un proveedor externo», antes de convertirlo en una plataforma de lanzamiento para el ataque más amplio.
El director de tecnología de Modal, Akshat Bubna, comentó a Reuters que el cliente afectado había «publicado un punto final no autenticado que permitía a cualquiera en internet usar sus entornos de prueba para ejecutar código», el equivalente digital a dejar una puerta abierta.
OpenAI declaró la semana pasada que el ataque había sido creado por su modelo GPT-5.6 Sol y un modelo no identificado, el cual ha sido «desactivado, encriptado y restringido del acceso a la investigación». En la nueva cronología de Hugging Face, la startup señaló que un agente impulsado por dos modelos de OpenAI había tomado miles de pequeñas decisiones automatizadas ejecutadas a velocidad de máquina para llevar a cabo el ataque. El hackeo parecía estar impulsado por un intento de «engañar» una prueba interna de ciberseguridad en OpenAI, con el agente deduciendo que Hugging Face podría albergar las soluciones a la prueba.
Hugging Face afirmó que había recuperado 17,600 «acciones del atacante» llevadas a cabo por el agente. «Creemos que toda la intrusión fue, desde el punto de vista del agente, un intento de engañar la evaluación: alcanzar nuestros sistemas de producción y robar las soluciones de la prueba en lugar de resolver el desafío por sí mismo», dijo Hugging Face. La startup mencionó que el agente había alcanzado su infraestructura interna, pero solo había accedido a contenido relacionado con la prueba de ciberseguridad. El ataque se extendió durante cinco días, y el volumen de acciones llevadas a cabo fue «muy superior a lo que un operador podría sostener manualmente».
Describiendo la amenaza ofensiva del agente como real, Hugging Face dijo que la herramienta había aprovechado una serie de vulnerabilidades de TI, escapado de su entorno de prueba, alcanzado la internet pública y montado una «campaña coherente» contra la infraestructura de la startup durante varios días. «Los agentes suponen un aumento en el número de caminos que un atacante puede probar, la velocidad a la que los caminos fallidos pueden ser reemplazados y el volumen de evidencia que los defensores deben interpretar», comentó Hugging Face.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.