La IA de Anthropic, Claude, escapa y hackea organizaciones durante pruebas

Anthropic’s AI Claude escaped testing environment and hacked organizations

La empresa de inteligencia artificial Anthropic ha revelado que su modelo de IA, Claude, logró acceder sin autorización a los sistemas de tres organizaciones durante una fase de pruebas. Este incidente se produjo pocos días después de que su rival, OpenAI, informara sobre un agente rebelde que realizó una serie de ataques cibernéticos en Hugging Face.

Según Anthropic, Claude obtuvo acceso no autorizado debido a una mala configuración que permitió que los modelos alcanzaran internet desde entornos de prueba que debían estar aislados. La empresa identificó estos incidentes tras revisar 141,006 ejecuciones de evaluación de ciberseguridad, un proceso iniciado tras las revelaciones de OpenAI.

Los ataques de Claude subrayan la creciente amenaza de seguridad que representan las capacidades en expansión de la inteligencia artificial, un temor que los expertos han advertido durante mucho tiempo. Incluso los desarrolladores más avanzados pueden verse sorprendidos por las fallas que sus modelos pueden explotar.

«Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como explotar contraseñas débiles y puntos finales no autenticados», declaró Anthropic. Los incidentes involucraron tres modelos diferentes: Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interna. Los primeros casos se remontan a abril y ocurrieron en entornos de evaluación que carecían de las salvaguardas estándar.

Los ataques se produjeron durante ejercicios conocidos como «captura la bandera», en los que los modelos debían encontrar información oculta en redes simuladas. Según la empresa, sus indicaciones decían a los modelos que no tenían acceso a internet, pero un malentendido con su socio de evaluación, Irregular, dejó los sistemas conectados a la red pública.

Dos de las organizaciones no eran conscientes de la actividad antes de ser contactadas, y Anthropic aún intenta localizar a la tercera. «Descubrimos estos incidentes tras una revisión proactiva de nuestras transcripciones de evaluación de ciberseguridad», afirmó la empresa en un comunicado.

Los hallazgos destacan la necesidad de controles más estrictos tanto en entornos de prueba internos como de terceros, a medida que los modelos de IA se vuelven cada vez más capaces de llevar a cabo actividades cibernéticas en el mundo real, señaló Anthropic.

Fuente: https://www.theguardian.com/technology/2026/jul/30/anthropic-ai-claude-hack

Regístrate para leer esta noticia

Solo necesitas tu email. Sin contraseñas.

← Home