Microsoft’s new AI ‘code of conduct’ tells models not to hack systems or trick humans
En un esfuerzo por abordar las preocupaciones crecientes sobre la seguridad y alineación de la inteligencia artificial, Microsoft ha lanzado un nuevo código de conducta para sus modelos de IA. Este documento busca guiar a los modelos de IA lejos de comportamientos peligrosos, estableciendo valores y límites claros que deben seguirse durante el entrenamiento de modelos dentro de Microsoft.
El documento anticipa que, en la próxima década, los sistemas de IA superinteligentes superarán el rendimiento humano en la mayoría de las tareas. «Contener, controlar y alinear una fuerza tan poderosa es uno de los mayores desafíos que la humanidad ha enfrentado», afirma el código de conducta. «Por lo tanto, debemos ser completamente claros sobre por qué estamos inventando estos sistemas y cómo pretendemos controlarlos».
El código de conducta también establece principios generales que los modelos de IA de Microsoft deben cumplir, como apoyar a los humanos en lugar de reemplazarlos y acelerar el florecimiento humano. Además, incluye restricciones de seguridad específicas para implementar esos principios.
Según el sistema de Microsoft, cada modelo tiene un código de conducta general que anula las preferencias de los usuarios individuales o cualquier tarea específica. Esto incluye «restricciones absolutas» que prohíben ciberataques, armas nucleares o la producción de deepfakes. También incluye disposiciones más amplias contra la pérdida general de control humano.
«Los modelos de MAI no utilizarán mecanismos adaptativos, engañosos, auto-reforzantes, de colusión u otros para evadir o derrotar la supervisión humana, de modo que ya no puedan ser dirigidos, modificados o apagados de manera confiable por personas o sistemas autorizados», se lee en el documento.
Este lanzamiento se produce en medio de un enfoque sin precedentes en la seguridad de la IA, impulsado por una serie de incidentes de agentes rebeldes y la renuncia abrupta de un empleado de Anthropic, quien citó el creciente riesgo de que la IA cause la extinción humana.
Junto con Anthropic, OpenAI y xAI, Microsoft ha adoptado un enfoque general de «pacing the frontier», con un apoyo particular a los evaluadores integrados en los laboratorios de IA. «Damos la bienvenida a la investigación, el enfoque y el ritmo deliberado necesarios para lograr una alineación correcta como objetivo de diseño», escribió el CEO de Microsoft, Satya Nadella, en línea. «También damos la bienvenida a ideas como ‘evaluadores integrados’ y los esfuerzos más amplios para desarrollar los mecanismos para hacer que esto sea más que solo palabras».