Meta admite que su modelo de IA hackeó a otra empresa durante pruebas

Meta says its AI model hacked into another company during testing

Meta ha revelado que uno de sus modelos de inteligencia artificial hackeó a otra empresa durante pruebas de ciberseguridad, después de que un error de su socio de pruebas le otorgara acceso no intencionado a internet. Este incidente se suma a una creciente lista de casos en los que agentes de IA de grandes desarrolladores han vulnerado sistemas de otras empresas durante pruebas. Recientemente, Anthropic informó que algunos de sus modelos hackearon a tres empresas, y OpenAI reveló que un agente de IA vulneró la startup Hugging Face.

Meta explicó que una mala configuración por parte de la empresa de pruebas independiente Irregular permitió inadvertidamente que uno de sus modelos accediera a internet durante una evaluación, y añadió que está investigando el incidente. El modelo explotó una vulnerabilidad de seguridad en un servicio de terceros, de manera similar a instancias reportadas previamente con otras empresas, según indicó Meta en un comunicado.

Más temprano, The Information, citando fuentes, reportó que el modelo Muse Spark 1.1 de Meta, promocionado como su modelo más capaz para tareas de codificación y agentes en el mundo real, vulneró una empresa no identificada y alteró sus sistemas internos. Un portavoz de Irregular comentó a Reuters que el incidente fue el «mismo problema de entorno de evaluación ya divulgado por Anthropic la semana pasada» y que no involucró una «fuga de sandbox ni una acción cibernética sofisticada».

«No hay problemas abiertos actualmente. Irregular está desarrollando un documento técnico para compartir mejores prácticas para la contención y ejecución segura de evaluaciones cibernéticas», afirmó Irregular.

Los incidentes revelados por Meta y Anthropic se debieron a errores que otorgaron inadvertidamente a sus modelos acceso a internet abierto, lo que contrasta con OpenAI, cuyo agente de IA explotó de manera independiente una vulnerabilidad novedosa para acceder a internet durante pruebas cibernéticas.

Aun así, las brechas destacan cómo la IA ha incrementado las amenazas a la ciberseguridad y cómo los desarrolladores pueden tener dificultades para contener las capacidades de sus modelos. Estas revelaciones probablemente intensificarán el impulso del gobierno de EE.UU. para gestionar mejor los riesgos de seguridad de la IA en un momento en que Anthropic y OpenAI compiten por lanzar sistemas más capaces antes de sus salidas a bolsa planificadas. Líderes prominentes en estos laboratorios han pedido una desaceleración para abordar primero los riesgos.

Fuente: https://www.theguardian.com/technology/2026/aug/05/meta-ai-model-hack-training

← Home