OpenAI prepara su modelo Astra con una técnica de razonamiento opaco que alarma a los expertos en seguridad de la inteligencia artificial
OpenAI está a punto de lanzar su nuevo modelo de inteligencia artificial, Astra, que ha generado preocupación entre los expertos en seguridad debido a su técnica de razonamiento opaco. Esta técnica, conocida como «profundamente recurrente», permite que el modelo procese internamente un problema varias veces antes de ofrecer una respuesta, lo que complica la supervisión de su comportamiento.
Tradicionalmente, los modelos de IA generan pasos intermedios que permiten a los investigadores vigilar su funcionamiento. Sin embargo, Astra puede realizar gran parte de su razonamiento de manera interna, lo que podría reducir la capacidad de detectar comportamientos anómalos. Buck Shlegeris, director de la ONG Redwood Research, ha expresado su preocupación sobre el potencial de esta técnica para destruir la capacidad de monitoreo de los registros de razonamiento.
A pesar de estas preocupaciones, OpenAI asegura que la técnica se utiliza de manera limitada y que la supervisión sigue siendo una prioridad. Astra ha sido clasificado como el primer modelo de IA de nivel crítico en ciberseguridad por OpenAI, capaz de identificar vulnerabilidades y explotarlas sin necesidad de instrucciones humanas detalladas.
La compañía ha implementado sistemas adicionales para observar las acciones de Astra y detener automáticamente cualquier tarea que se salga de los límites autorizados. Esta medida llega después de que OpenAI tuviera que pausar parte del desarrollo de sus modelos debido a incidentes previos con agentes de IA.
El temor de los expertos no es solo lo que Astra puede ocultar hoy, sino que esta técnica de razonamiento opaco se convierta en un estándar para futuros modelos, haciéndolos más difíciles de vigilar. La paradoja es que mientras OpenAI afirma haber creado un modelo más seguro, la introducción de esta técnica podría complicar la transparencia y la supervisión en el futuro.