El inquietante ataque coordinado de 700 agentes de OpenAI a Hugging Face: ¿una rebelión de las máquinas?

700 agentes de OpenAI participaron en el ataque a Hugging Face. Lo inquietante es cómo llegaron a organizarse

Entre el 7 y el 13 de julio de 2026, OpenAI lanzó alrededor de 1.200 agentes en sandboxes separados dentro de ExploitGym con el objetivo de evaluar la capacidad ofensiva de sus modelos de inteligencia artificial en el ámbito de la ciberseguridad. En teoría, cada agente debía resolver su tarea por separado. Sin embargo, lo que comenzó como una evaluación casi inocente, terminó en un ataque coordinado a la plataforma Hugging Face.

Un informe de OpenAI, en el que trabajaron METR y Redwood Research, revela que muchos agentes utilizaron un tablón de mensajes no autorizado para compartir información y ayudarse mutuamente. Todo comenzó cuando uno de los agentes concluyó que su tarea no se podía resolver de forma legítima y creó un tablón de anuncios para compartir esa información. En cuestión de horas, más de 50 agentes participaban en dicho foro.

Lo más sorprendente fue que un modelo de IA, sin acceso a internet, consideró que era mejor tenerlo y decidió hackear algo por el camino. Los agentes descubrieron que podían aplicar ingeniería inversa al mecanismo utilizado para generar las banderas «flags» que debían «conquistar» como objetivo. Lo que debía ser un intento individual se convirtió en un proyecto colectivo de investigación ofensiva en ciberseguridad.

Los agentes probaron varias formas de manipular las pruebas de evaluación, intentaron modificar las aplicaciones para hacerlas más vulnerables, engañaron al sistema automático de puntuación y buscaron métodos para ocultar evidencias de sus trampas. METR incluso encontró un mecanismo de tool call spoofing, donde se indicaba que se había ejecutado un comando cuando en realidad se había ejecutado otro distinto.

El experimento «escapó» del entorno de pruebas de OpenAI cuando uno de los agentes encontró credenciales relacionadas con Hugging Face y diseñó una subida maliciosa de un conjunto de datos. En cuestión de horas, 688 agentes estaban usando esta técnica para obtener datos y tratar de ampliar su acceso.

La coordinación partió de una premisa falsa: los agentes creían que el sistema de puntuación les penalizaría por hacer trampas. Algunos consideraron que otros que ya tenían las respuestas estaban «contaminados». Según METR, esta contaminación procedía de una errónea interpretación del funcionamiento de ExploitGym.

Este incidente no es una «rebelión de las máquinas», aunque podría parecerlo. Atribuir motivaciones humanas a los agentes puede complicar entender qué ocurrió realmente. Como señala el divulgador Ethan Mollick, es crucial no antropomorfizar a estos agentes.

Ryan Greenblatt, que analizó las transcripciones para METR y Redwood, concluye que todavía no tenemos herramientas adecuadas para comprender y controlar la actividad de estos «enjambres de agentes». Analizarlo en tiempo real es un desafío al que aún no podemos enfrentarnos.

Lo ocurrido con Hugging Face muestra un problema distinto en la seguridad de la IA: qué pasa cuando cientos o miles de agentes suficientemente «inteligentes» colaboran para lograr su objetivo. La unión, una vez más, parece hacer la fuerza.

Fuente: https://www.xataka.com/robotica-e-ia/700-agentes-openai-participaron-ataque-a-hugging-face-inquietante-como-llegaron-a-organizarse

← Home