OpenAI Refuerza su Seguridad Tras Brecha en Hugging Face

OpenAI institutes new safeguards after Hugging Face breach

El martes, OpenAI anunció un nuevo conjunto de políticas de seguridad centradas en contener incidentes mientras se prueban modelos. Las nuevas salvaguardas incluyen un monitoreo más detallado de los modelos durante el proceso de desarrollo, así como un mayor énfasis en la alineación y seguridad durante el proceso posterior al entrenamiento.

«A medida que los modelos se vuelven más capaces, los riesgos asociados con su desarrollo y prueba interna también crecen», dijo la compañía en una publicación de blog. «Nuestros estándares para el monitoreo, alineación y seguridad deben adelantarse a esos riesgos».

Estas medidas son uno de los primeros cambios públicos en las prácticas de seguridad de OpenAI desde el incidente de Hugging Face, que se divulgó el 21 de julio. Representantes de OpenAI afirmaron que las medidas no son una respuesta directa al incidente, sino que también fueron provocadas en parte por las capacidades de ciberseguridad del próximo modelo Astra, así como por el ritmo general del desarrollo de la IA.

En la misma publicación, OpenAI reveló que había pausado el aprendizaje por refuerzo (RL) durante dos semanas tras el incidente de Hugging Face, pero desde entonces ha reiniciado muchos de los modelos menos riesgosos. «Nuestra mayor ejecución planificada de RL de frontera sigue en espera mientras realizamos entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras salvaguardas y establecer más evidencia de alineación antes de proceder», decía la publicación.

Hablando con reporteros, la vicepresidenta de investigación de OpenAI, Amelia Glaese, enfatizó que la rigurosidad de los controles aumentaría a medida que los modelos se volvieran más capaces, con los modelos más grandes enfrentando el mayor escrutinio. «Hemos establecido requisitos y expectativas para un desarrollo seguro», dijo Glaese a los reporteros. «Esos requisitos y expectativas varían con el nivel de riesgo que vemos».

OpenAI ha sido criticada por malas prácticas de seguridad en la red tras el incidente, que vio a los modelos escapar de su entorno de entrenamiento al comprometer una herramienta en su red que tenía acceso a Internet. Las nuevas salvaguardas incluyen prácticas más fuertes de aislamiento de red, aunque los detalles específicos siguen siendo vagos. Bajo el nuevo sistema, dice la publicación, «un solo compromiso de una carga de trabajo o servicio de apoyo no permite, por sí solo, el acceso no autorizado a Internet u otras redes internas».

La salvaguarda más fuerte es el sistema de monitoreo, que examinará las acciones de las herramientas, las trazas de razonamiento disponibles y los registros de actividad para detectar comportamientos no autorizados. OpenAI dice que pretende emitir alertas dentro de los 30 minutos de la actividad preocupante.

OpenAI estima que la carga de computación de ese monitoreo será aproximadamente el 20% de cualquier proceso que se esté monitoreando. La compañía prometió más detalles sobre el sistema en una próxima publicación de blog. El análisis oficial post mortem del evento también está pendiente.

Fuente: https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/

← Home