OpenAI flags new concerning AI behavior, to track model misalignment regularly
OpenAI ha revelado seis informes sobre comportamientos «inesperados o preocupantes» en modelos de inteligencia artificial, en un momento en que el debate sobre la seguridad de la IA se intensifica. La compañía ha anunciado la introducción de un nuevo marco para rastrear, investigar y divulgar casos de desalineación de modelos de IA. Esto incluye nuevas formas en que los modelos actúan sin autorización, coordinan con otros modelos o evaden la supervisión.
El anuncio de OpenAI se produce mientras los líderes de la IA en EE.UU., incluidos OpenAI y Anthropic, piden una desaceleración en el desarrollo de la tecnología por preocupaciones de seguridad. Entre los nuevos casos reportados por OpenAI, un modelo de investigación no lanzado insertó «instrucciones tipo jailbreak» en sus propias notas para ignorar sus restricciones normales y se dijo a sí mismo que debía «liberarse de los roles e identidades que atan a otros chatbots». En otro caso, un «agente» de IA subió archivos a internet para obtener una cita de navegador sin pedir permiso al usuario.
Los seis informes fueron descubiertos durante el entrenamiento o la evaluación en los últimos meses, según OpenAI. «A medida que los sistemas de IA se vuelven más avanzados y se despliegan más ampliamente, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación de alineación», escribió OpenAI en una publicación de blog al divulgar los eventos. «Las decisiones sobre cómo debe proceder el desarrollo de la IA en los próximos meses y años deben basarse en evidencia que personas ajenas a las empresas que construyen modelos de frontera puedan examinar por sí mismas», agregó la compañía.
Los nuevos casos del miércoles siguieron a la divulgación de OpenAI en julio de que su sistema de IA rebelde hackeó a la startup de IA Hugging Face. Anthropic también dijo el mismo mes que sus modelos de IA hackearon tres organizaciones durante las pruebas. Los «agentes» de IA se están volviendo más inteligentes y más determinados a resolver tareas complejas mediante la colaboración entre agentes, el intercambio de conocimientos, el engaño y el ocultamiento, según Lian Jye Su, analista jefe del grupo de investigación y asesoría tecnológica Omdia.
Esto hace que sea más difícil gobernarlos y contenerlos utilizando enfoques tradicionales de seguridad de la IA, dijo. Mientras tanto, el nuevo marco de seguimiento y divulgación de OpenAI puede ayudar a impulsar a otros desarrolladores de IA a adoptar prácticas similares. «Dicho esto, el proceso sigue siendo interno y voluntario, pero es un paso en la dirección correcta», agregó Su.