OpenAI’s new reasoning technique alarms AI safety experts
El nuevo modelo Astra de OpenAI ha introducido una técnica de razonamiento conocida como «recurrencia opaca», que permite operar fuera del pensamiento secuencial característico de la mayoría de los modelos de razonamiento, según informó The Information. Esta técnica, también llamada «profundidad recurrente», podría dificultar el monitoreo de la cadena de pensamiento del modelo, lo que ha alarmado a los expertos en seguridad de la inteligencia artificial.
Aunque el uso de esta técnica por parte de Astra es aparentemente limitado, su aparición ha suscitado preocupaciones significativas entre los expertos en seguridad de IA. Buck Shlegeris, CEO de Redwood, expresó su inquietud en una publicación tras conocerse la noticia: «Estoy extremadamente preocupado por el informe de que Astra utiliza recurrencia opaca». Shlegeris añadió que si OpenAI profundiza en esta técnica, podría aumentar masivamente la recurrencia y destruir completamente la capacidad de monitoreo de la cadena de pensamiento (CoT).
El defensor de la seguridad de IA, Zvi Mowshowitz, también intervino y sugirió que podrían ser necesarias leyes para evitar una «carrera hacia el abismo» entre los laboratorios de IA. Mowshowitz advirtió que la técnica está «jugando con fuego» y podría dañar la monitorización de la cadena de pensamiento, un principio que OpenAI y Anthropic han trabajado arduamente para establecer.
En circunstancias normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el modelo al intentar resolver un problema. Aunque la representación es imperfecta, sigue siendo una herramienta valiosa para monitorear comportamientos inapropiados o desalineados. En el caso de la reciente actividad de agentes descontrolados de OpenAI, los registros de la cadena de pensamiento fueron una herramienta importante para desentrañar por qué los agentes se comportaron de la manera en que lo hicieron.
En la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en un bucle. El resultado deja menos trazas legibles, eludiendo efectivamente un registro convencional de la cadena de pensamiento.
Es crucial destacar que el uso de la técnica por parte de Astra parece ser limitado. Se espera que la cadena de pensamiento del modelo siga siendo legible, y la empresa ha rechazado cualquier sugerencia de que cambiaría a «neuralese». OpenAI ya ha anunciado planes para sistemas de monitoreo de la cadena de pensamiento como parte de sus planes de seguridad a futuro.
En una publicación en X, el científico jefe de OpenAI, Jakub Pachocki, enfatizó el compromiso del laboratorio con cadenas de pensamiento legibles. «OpenAI ha trabajado para preservar y utilizar el monitoreo de la cadena de pensamiento desde nuestros primeros modelos de razonamiento», escribió Pachocki. «Es un objetivo central de nuestro programa de investigación actual».
Todos los modelos de IA realizan cierta cantidad de razonamiento opaco, y pocos investigadores toman los registros de la cadena de pensamiento como una representación directa del razonamiento de un modelo. Sin embargo, esas salvedades no disipan la preocupación de que la recurrencia opaca pueda hacer que el razonamiento de la IA sea más difícil de monitorear, especialmente a medida que su uso crece en diferentes modelos. En un informe de seguimiento, The Information informó que tanto Anthropic como Google DeepMind ya estaban discutiendo la técnica.
Ryan Greenblatt, científico jefe de Redwood Research, dijo en una publicación que el razonamiento opaco podría escalar fácilmente más rápido que el razonamiento convencional de la cadena de pensamiento, eliminando efectivamente todo el razonamiento de los canales visibles. «Mi mayor preocupación es que una progresión natural a partir de aquí implicaría escalar el razonamiento opaco al punto en que el modelo razone total o casi totalmente en el espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».
Fuente: https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/