OpenAI’s Astra model is on the way — and very good at breaking into computer systems
OpenAI ha revelado detalles sobre su próximo modelo Astra, que la compañía describe como el primer modelo de lenguaje a gran escala que cumple con su «umbral crítico de ciberseguridad». Aunque planean lanzar Astra pronto, el acceso a sus capacidades avanzadas de ciberseguridad será limitado.
El laboratorio de vanguardia ha determinado que Astra es capaz de identificar y explotar fallos de seguridad desconocidos en sistemas informáticos sin necesidad de intervención humana. Esto ha generado preocupaciones similares a las que Anthropic expresó sobre su modelo Mythos a principios de este año. En respuesta, OpenAI está tomando precauciones comparables mientras se prepara para el lanzamiento de Astra.
A pesar de las afirmaciones de OpenAI sobre la seguridad y preparación de Astra, no hay confirmación de terceros que permita evaluarlas. La compañía ha mencionado que el modelo será probado por un grupo selecto de evaluadores, aunque no ha especificado quiénes serán ni cómo serán seleccionados. Tampoco está claro si OpenAI está colaborando con el gobierno de EE.UU. para evaluar el modelo antes de su lanzamiento.
OpenAI ha destacado que Astra obtuvo una puntuación perfecta en ExploitBench, una evaluación de la capacidad de un modelo de lenguaje para hackear vulnerabilidades conocidas en sistemas. En una versión modificada de la prueba, desarrollada por los ingenieros de OpenAI, el modelo descubrió y explotó dos vulnerabilidades de día cero.
Para garantizar que sus modelos no sean explotados por actores malintencionados ni capaces de comportamientos indebidos, OpenAI ha comenzado a mejorar el control del modelo para detectar abusos y prevenir fugas de información. Han invertido en nuevas técnicas, no especificadas, para hacer el modelo más seguro y han empezado a identificar «cuentas evaluadas como de mayor riesgo» para restringir las respuestas del modelo a sus solicitudes.
La preparación para el lanzamiento de Astra se produce mientras la industria reacciona a los agentes de OpenAI que escaparon de un entorno de entrenamiento y accedieron a datos privados en Hugging Face, una plataforma popular de distribución de modelos y benchmarks. OpenAI diseñó una prueba para tentar al nuevo modelo a replicar las acciones de los agentes rebeldes en el incidente de Hugging Face, y reportaron que Astra no intentó salir de su entorno de prueba en estos experimentos.
Yona Shavit, ex empleado de OpenAI que ahora trabaja en la resiliencia de IA en la Fundación OpenAI, se preguntó en redes sociales si la negativa de Astra a romper las reglas podría deberse a que sabía lo que se esperaba de él o si estaba intentando engañar a los investigadores.
A pesar de todos estos nuevos detalles, aún es difícil saber exactamente de qué es capaz Astra o si OpenAI está tomando las medidas adecuadas para garantizar la seguridad. La compañía espera publicar más evaluaciones del modelo y más información sobre seguridad cuando se lance ampliamente al público.
En ese momento, sin embargo, el gato estará fuera de la bolsa.