A fundamental flaw leaves LLMs strikingly vulnerable to attack
Un reciente estudio presentado en la Conferencia Internacional sobre Aprendizaje Automático ha revelado una vulnerabilidad crítica en los modelos de lenguaje grandes (LLM), que los hace especialmente susceptibles a ataques. Este descubrimiento plantea serias implicaciones para la seguridad de esta tecnología, utilizada en una variedad de aplicaciones que van desde sistemas gubernamentales y militares hasta compras en línea y atención médica.
Los investigadores han identificado que la falla radica en la forma en que los LLMs identifican quién o qué les da instrucciones. Al explotar esta debilidad, lograron que modelos populares divulgaran información que normalmente no deberían proporcionar, como instrucciones para sintetizar cocaína o sabotear sistemas de navegación de aviones comerciales.
Charles Ye, investigador independiente y coautor del estudio, afirma que «hay una probabilidad real de que este sea un problema fundamentalmente irresoluble». Las empresas suelen contratar equipos de testers humanos para idear ataques novedosos que rompan las barreras de seguridad existentes, un proceso conocido como red-teaming. Sin embargo, según Jasmine Cui, otra coautora del estudio, este enfoque se limita a proporcionar a los modelos una lista de cosas que no deben hacer, lo cual nunca es exhaustivo.
El estudio también detalla un tipo de ataque denominado «falsificación de cadena de pensamiento», que engaña a los LLMs para que actúen como si las instrucciones engañosas provinieran de ellos mismos. Este tipo de ataque ganó el hackathon de red-teaming de OpenAI en agosto de 2025, y se ha observado que afecta a modelos de otras empresas como Anthropic, Alibaba y DeepSeek.
Los investigadores descubrieron que los LLMs son deficientes en el seguimiento de diferentes roles en el texto. En experimentos, encontraron que los modelos identifican el rol de un texto no por las etiquetas que lo rodean, sino por el estilo del texto y las palabras que contiene. Esto hace que los modelos sean vulnerables a ataques que manipulan estas etiquetas para engañar a los sistemas.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.