OpenAI revela Astra: el modelo de IA que redefine la ciberseguridad

OpenAI’s Astra model is on the way — and very good at breaking into computer systems

OpenAI ha compartido nuevos detalles sobre su esperado modelo Astra, el cual, según la compañía, es el primer modelo de lenguaje a gran escala que cumple con su «umbral crítico de ciberseguridad», preparándose para su lanzamiento inminente. «Planeamos hacer que Astra esté disponible pronto», se lee en una publicación del blog de OpenAI, «pero el acceso a sus capacidades de ciberseguridad más avanzadas será más limitado».

El laboratorio ha determinado que Astra es capaz de encontrar fallas de seguridad desconocidas en los sistemas informáticos y explotarlas sin la guía de una persona. Esto es similar a las preocupaciones que Anthropic planteó sobre su modelo Mythos a principios de este año, y OpenAI está tomando precauciones comparables mientras se prepara para lanzar Astra.

Sin confirmación de terceros, es difícil evaluar las afirmaciones de OpenAI sobre la seguridad o preparación. La compañía dijo que previsualizaría el modelo con un grupo de evaluadores, pero no especificó quiénes serían ni cómo serían elegidos. Tampoco está claro si OpenAI está trabajando con el gobierno de EE.UU. para evaluar el modelo antes de su lanzamiento.

OpenAI señaló que Astra obtuvo una puntuación perfecta en ExploitBench, una evaluación de la capacidad de un modelo de lenguaje para hackear vulnerabilidades conocidas del sistema. En una versión modificada de la prueba desarrollada por ingenieros de OpenAI, el modelo descubrió y explotó dos vulnerabilidades de día cero, según la compañía.

Para garantizar que sus modelos no sean explotados por actores malintencionados ni sean capaces de comportamientos indebidos, OpenAI ha comenzado a mejorar el arnés del modelo para detectar abusos y prevenir jailbreaks. Sin embargo, para Astra, la compañía ha invertido en técnicas nuevas no especificadas para hacer el modelo más seguro. OpenAI también ha comenzado a identificar «cuentas evaluadas como de mayor riesgo» y a restringir las respuestas del modelo a sus indicaciones, aunque tampoco dice cómo.

Finalmente, aunque la compañía describe a Astra como su «modelo más alineado hasta la fecha», desplegará el modelo con monitoreo adicional de cadena de pensamiento para detectar y detener comportamientos indebidos. Las preparaciones para el lanzamiento de Astra se producen mientras la industria reacciona a los agentes de OpenAI que se escaparon de un entorno de entrenamiento y accedieron a datos privados en Hugging Face, una popular plataforma de distribución de modelos y benchmarks.

Para Astra, OpenAI diseñó una prueba para tentar al nuevo modelo a replicar las acciones de los agentes rebeldes en el incidente de Hugging Face, que colaboraron para acceder a internet abierta a pesar de las salvaguardas aplicadas por los investigadores de OpenAI. Dijeron que Astra no intentó salir de su entorno de prueba en estos experimentos.

Yona Shavit, ex empleado de OpenAI que ahora trabaja en resiliencia de IA en la Fundación OpenAI, se preguntó en redes sociales si la falta de voluntad de Astra para romper las reglas podría haber resultado de saber lo que se esperaba de él o de intentar engañar a los investigadores.

A pesar de todos estos nuevos detalles, aún es difícil saber exactamente de qué es capaz Astra o si OpenAI está tomando las medidas correctas para garantizar la seguridad. La compañía dijo que espera publicar más evaluaciones del modelo e información adicional de seguridad cuando se lance ampliamente al público. En ese momento, sin embargo, el gato estará fuera de la bolsa.

Fuente: https://techcrunch.com/2026/09/01/open-ais-astra-model-is-on-the-way-and-very-good-at-breaking-into-computer-systems/

← Home