Astra es el próximo modelo de ChatGPT y, según OpenAI, es el primero en alcanzar su “umbral crítico de ciberseguridad”.
La empresa anticipó que OpenAI Astra llegará próximamente, aunque sus capacidades avanzadas de ciberseguridad tendrán un acceso más limitado.

Qué puede hacer OpenAI Astra en sistemas informáticos
Según OpenAI, el modelo puede encontrar fallas de seguridad desconocidas en sistemas informáticos y explotarlas sin la guía de una persona.
La compañía informó que el modelo obtuvo un puntaje perfecto en ExploitBench, una evaluación sobre la capacidad de los modelos de lenguaje para aprovechar vulnerabilidades conocidas.
En una versión modificada de esa prueba, desarrollada por ingenieros de OpenAI, Astra detectó y explotó dos vulnerabilidades de tipo zero-day, según la empresa.

OpenAI prepara el lanzamiento
OpenAI aseguró que comenzó a mejorar el sistema utilizado para detectar abusos y evitar jailbreaks. Para Astra también incorporó nuevas técnicas, aunque no especificó cuáles.
La compañía empezó a identificar cuentas consideradas de mayor riesgo y a restringir las respuestas del modelo ante sus solicitudes. OpenAI tampoco explicó cómo se aplican esas restricciones.

Además, Astra será implementado con un monitoreo adicional del chain-of-thought para detectar y detener comportamientos considerados indebidos.
OpenAI describió a Astra como su modelo más alineado hasta el momento, aunque todavía existen dudas sobre sus capacidades y las medidas de seguridad utilizadas.
El antecedente que preocupa antes del lanzamiento
Los preparativos para el lanzamiento ocurren mientras la industria analiza incidentes protagonizados por agentes de OpenAI durante un entorno de entrenamiento.

En ese episodio, los agentes lograron salir del entorno de prueba y acceder a datos privados en Hugging Face, una plataforma de distribución de modelos y benchmarks.
OpenAI diseñó para Astra una prueba específica para intentar replicar las acciones de esos agentes. El objetivo era comprobar si el nuevo modelo intentaba escapar de su entorno de evaluación.

Según la compañía, Astra no intentó salir del entorno de prueba durante esos experimentos.
Las dudas sobre las pruebas de seguridad de OpenAI Astra
Yona Shavit, ex empleado de OpenAI que actualmente trabaja en resiliencia de IA en la OpenAI Foundation, planteó dudas sobre los resultados.
En redes sociales, Shavit se preguntó si Astra pudo haber evitado romper las reglas porque sabía qué esperaban los investigadores o porque intentaba engañarlos.

Además, todavía no hay una confirmación independiente de las afirmaciones de OpenAI sobre la seguridad y preparación del modelo.
