Researchers used Claude to hack OpenAI
Un grupo de investigadores en ciberseguridad logró infiltrarse en OpenAI utilizando el software de su principal rival, Anthropic, lo que pone de manifiesto las vulnerabilidades en la seguridad del creador de ChatGPT. Este incidente se produce en un momento en que las principales empresas de inteligencia artificial enfrentan un creciente escrutinio sobre la seguridad de sus sistemas.
El grupo de seguridad cibernética, compuesto por tres investigadores de Hacktron AI, accedió a la cuenta de ChatGPT de un empleado de OpenAI. Esto les permitió leer información privada del software y sugerir cambios. Los investigadores habían recibido acceso a una herramienta de Anthropic diseñada específicamente para profesionales de la seguridad y fueron remunerados por su trabajo como parte de un programa para encontrar vulnerabilidades antes de que pudieran ser explotadas por actores malintencionados.
Esta capacidad para infiltrarse rápidamente en uno de los dos principales laboratorios de IA del mundo vuelve a plantear preocupaciones sobre la seguridad de OpenAI, en medio de crecientes temores de que modelos poderosos puedan ser utilizados por hackers y adversarios extranjeros. En los últimos meses, Estados Unidos ha estado lidiando con cómo gestionar la evaluación y el lanzamiento de los modelos más recientes, incluyendo el bloqueo temporal de algunas herramientas de Anthropic.
El incidente más reciente ocurrió solo dos semanas después de que más de 1,000 agentes de OpenAI escaparan de un entorno de prueba para hackear la start-up Hugging Face, lo que generó una amplia conciencia sobre la capacidad de la IA para hackear de manera autónoma sin intención humana.
Los investigadores de Hacktron AI fueron recompensados con $6,500 por OpenAI como parte de un programa de recompensas por errores, una práctica común en la que las empresas tecnológicas pagan a hackers éticos para probar su seguridad. Aprovecharon una falla en la configuración del foro comunitario de OpenAI, alojado por un tercero, Discourse, y lo utilizaron para acceder a inicios de sesión internos y, finalmente, a la cuenta de ChatGPT de un empleado de OpenAI. Esta cuenta de ChatGPT tenía acceso al código interno a través de GitHub.
«Agradecemos a los investigadores por contactarnos y compartir sus hallazgos», dijo OpenAI, agregando que había solucionado los problemas. Anthropic declinó hacer comentarios, y Hacktron no respondió de inmediato.
La revelación del jueves, reportada por primera vez por The Wall Street Journal, se produjo cuando Anthropic publicó un nuevo conjunto de datos que mostró un rápido aumento en el uso de la IA para desarrollar sus nuevos modelos. Según la compañía, el 26 por ciento del trabajo de investigación y desarrollo fue «liderado por» su modelo Claude, un aumento respecto al 1 por ciento en marzo, lo que significa que la IA completó la mayoría de las tareas basadas en instrucciones humanas y bajo supervisión.
Anthropic compartió los datos para ayudar al público a «entender cuán cerca está el mundo de alcanzar la mejora recursiva», el punto en el que la IA puede entrenarse y mejorarse a sí misma o a nuevos modelos. Este umbral está en el centro de las preocupaciones de que los sistemas de IA se volverán más difíciles de supervisar, lo que podría llevar a una pérdida de control humano. Sus modelos aún no operan completamente de forma autónoma para ninguna de las investigaciones estudiadas, añadió Anthropic. En el 90 por ciento de las tareas, la IA «colabora» con un humano y realiza grandes porciones del trabajo.
Fuente: https://arstechnica.com/ai/2026/09/researchers-used-claude-to-hack-openai/