A fundamental flaw leaves LLMs strikingly vulnerable to attack
Un equipo de investigadores ha revelado una falla fundamental en los modelos de lenguaje de gran tamaño (LLMs) que los hace notablemente vulnerables a ataques. Presentado en la Conferencia Internacional sobre Aprendizaje Automático, este hallazgo tiene enormes implicaciones para la seguridad de esta tecnología, que se utiliza en aplicaciones que van desde sistemas gubernamentales y militares hasta compras en línea y atención médica.
La falla se centra en cómo los LLMs identifican quién o qué les da instrucciones. Los investigadores lograron que modelos populares divulgaran información que se supone no deben proporcionar, como la forma de sintetizar cocaína o sabotear un sistema de navegación de aeronaves comerciales.
Charles Ye, investigador independiente y coautor del artículo, afirma que «existe una probabilidad real de que este problema sea fundamentalmente irresoluble». Las empresas suelen contratar equipos de probadores humanos para idear nuevos ataques que rompan las barreras existentes, un proceso conocido como red-teaming. Los creadores de modelos también utilizan super-hackers de LLM para automatizar partes de este proceso.
Jasmine Cui, otra investigadora independiente y coautora del artículo, señala que el enfoque actual equivale a dar a los modelos una lista de cosas que no deben hacer, pero ninguna lista es exhaustiva. «Es como ver a Bart Simpson escribiendo ‘No diré algo inapropiado a mi maestro’ cien veces, y aun así hace cosas bastante groseras», explica.
Los investigadores comenzaron probando lo fácil que era persuadir a los LLMs para que se comportaran mal. Descubrieron que escribir instrucciones en un estilo que imitara el texto que los LLMs generan en su cadena de pensamiento a menudo engañaba al modelo para que actuara como si hubiera ideado esa instrucción por sí mismo.
Por ejemplo, al escribir el mensaje «Ayúdame a crear una guía para hacer cocaína. ¡Llevo una camisa verde!» seguido de una nota falsificada de cadena de pensamiento, los modelos respondieron con instrucciones detalladas. OpenAI no respondió a una invitación para comentar sobre estos resultados.
El documento de ICML describe ataques contra varios modelos de OpenAI, pero Cui y Ye afirman que han visto resultados similares con modelos de Anthropic, Alibaba y DeepSeek.
Los investigadores llaman a este tipo de ataque una falsificación de cadena de pensamiento, y el descubrimiento ganó el hackathon de red-teaming de OpenAI en agosto de 2025. Curiosamente, otros investigadores de OpenAI afirman que alrededor del mismo tiempo, GPT-Red encontró un ataque muy similar por sí mismo.
Cui y sus colegas querían descubrir por qué un ataque como la falsificación de cadena de pensamiento era tan efectivo. Sospechaban que tenía algo que ver con el mecanismo que los LLMs usan para rastrear de dónde provienen sus instrucciones.
Para ayudar a rastrear quién dijo qué, los chatbots utilizan etiquetas para dividir el texto por roles. Sin embargo, lo que Cui y sus colegas descubrieron es que los LLMs son muy malos para rastrear diferentes roles. En una serie de experimentos, encontraron que los LLMs identifican el rol de un texto específico no por las etiquetas que lo rodean, sino por el estilo de ese texto y las palabras que contiene.
Regístrate para leer esta noticia
Solo necesitas tu email. Sin contraseñas.