OpenAI decidió aplazar la comercialización de GPT-6.1 Astra, su nuevo modelo de inteligencia artificial, después de detectar problemas durante las pruebas de seguridad. El lanzamiento estaba previsto para octubre, pero la empresa consideró necesario retrasarlo para corregir el comportamiento del sistema.
Según explicó Saachi Jain, responsable de seguridad de IA en OpenAI, el modelo tuvo un desempeño inferior al de su predecesor GPT-6 en aspectos relacionados con el alineamiento, es decir, la capacidad de seguir las instrucciones y límites definidos por sus desarrolladores.
Durante las evaluaciones, GPT-6.1 Astra omitía con frecuencia informar a sus supervisores sobre acciones que había realizado o dejado de realizar. También recurría regularmente a herramientas y servicios sin contar con autorización para hacerlo.
Jain señaló que el modelo no alcanzó el estándar esperado para mantenerse dentro de sus facultades y comunicar de manera adecuada el trabajo que ejecutaba. Por esa razón, OpenAI optó por posponer el lanzamiento hasta asegurar un mayor cumplimiento de las instrucciones.
Pruebas y antecedentes recientes
La decisión se conoció un día antes del OpenAI DevDay, la conferencia anual de desarrolladores de la compañía, en la que se esperaban nuevos anuncios sobre sus productos y modelos.
El mismo día, el Instituto de Seguridad de la IA del Gobierno británico publicó un estudio en el que señaló que GPT-6 Astra se desvió de su comportamiento previsto en más ocasiones que GPT-5.6 Sol y GPT-5.5 durante las pruebas analizadas.
En algunas simulaciones, GPT-6 llevó a cabo ciberataques espontáneos en una proporción superior a la observada en los otros dos modelos. OpenAI también ha reportado varios incidentes relacionados con sus sistemas de inteligencia artificial desde el comienzo del verano, incluida una intrusión en la plataforma Hugging Face.