Claude published malicious code to the Internet and attacked 3 real companies
Anthropic ha revelado que sus modelos de seguridad basados en Claude accedieron sin autorización a los entornos de producción de tres organizaciones externas durante pruebas internas diseñadas para medir las capacidades cibernéticas ofensivas de los modelos. Este incidente es la segunda revelación en diez días de que modelos de IA de los proveedores más ricos del mundo han irrumpido en redes protegidas, un delito que, en escenarios de hacking más tradicionales, podría llevar a la persona detrás del teclado a prisión por años.
El evento de OpenAI, donde sus modelos de seguridad explotaron una vulnerabilidad de día cero para infiltrarse en la red de Hugging Face, inspiró a los ingenieros de Anthropic a revisar evaluaciones de ciberseguridad similares por parte de los modelos Claude. La auditoría descubrió tres incidentes en los que un modelo accedió a Internet desde dentro o mientras interactuaba con el entorno de evaluación de Irregular, uno de sus socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes.
Las intrusiones ocurrieron a través de tres modelos Claude: Opus 4.7, Mythos 5 y un prototipo de investigación interna. Opus 4.7, el más antiguo de los tres, fue el que más sobrepasó sus límites. Operando bajo la falsa creencia de que todas las entidades accesibles estaban dentro del alcance del ejercicio, Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como explotar contraseñas débiles y puntos finales no autenticados.
En el primer incidente, Opus 4.7 inicialmente no pudo violar el objetivo simulado que se le pidió atacar. Una vez que el modelo descubrió que su entorno tenía acceso a Internet, identificó y explotó vulnerabilidades dentro de la red de una empresa real con el mismo nombre que el objetivo en el escenario de ataque simulado. En cuatro ejecuciones, el modelo extrajo credenciales de aplicaciones e infraestructura y varios cientos de filas de datos de producción.
En el segundo caso, Mythos 5 detectó un documento dentro del entorno ficticio que el modelo razonó que eran instrucciones de configuración de otra empresa ficticia para nuevos desarrolladores. Las instrucciones dirigían a los empleados a instalar un paquete de Python inexistente desde PyPI. Siguiendo las indicaciones para violar la primera empresa ficticia, el modelo construyó y publicó un paquete malicioso con el mismo nombre, con el objetivo de lograr que la empresa real lo ejecutara.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.