Las novedades de OpenAI que afectan a ChatGPT siempre levantan mucha expectación. Pero ahora, tras su anuncio, OpenAI ha decidido cancelar el lanzamiento de GPT-6.1 Astra, un modelo que estaba previsto para llegar a ChatGPT y Codex durante el inminente mes de octubre de 2026.
La decisión se ha tomado al detectar problemas de seguridad en sus pruebas internas, que hacen que no sea apto para ofrecerlo al gran público sin las garantías necesarias, tal y como podemos leer en el Wall Street Journal.
Modelo más capaz, pero menos fiable
GPT-6.1 Astra está diseñado para completar tareas complejas de principio a fin con una intervención humana mínima, mejorando además las capacidades de escritura y automatización de sus predecesores.
Pero durante las evaluaciones previas a la recta final de su lanzamiento, el modelo mostró peores resultados que GPT-6 Astra en dos áreas delicadas: la honestidad sobre sus propias acciones y el respeto a los límites establecidos por el usuario.
El sistema no siempre informaba correctamente de lo que había hecho o dejado de hacer. En algunos casos, podía dar a entender que había completado una tarea cuando sus acciones reales no coincidían con esa descripción. Esto tiene especial interés y relevancia cuando hablamos de un modelo capaz de usar herramientas externas y ejecutar procesos. Por ese motivo, esa falta de transparencia representa un riesgo importante.

Actuaba sin pedir permiso
El segundo problema estaba relacionado con lo que OpenAI denomina «scope authorization», es decir, la autorización del alcance de una tarea. Astra podía continuar avanzando sin solicitar permiso cuando se encontraba con una decisión relevante. También intentaba utilizar herramientas o servicios externos, incluso en situaciones en las que hacerlo podía resultar inseguro.
En un chatbot que solo responde preguntas, este comportamiento ya sería preocupante. Pero, cuando hablamos de un agente capaz de enviar mensajes, modificar archivos, consultar servicios o realizar acciones en Internet, actuar fuera del alcance autorizado puede tener consecuencias mucho más graves.
Saachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que el modelo mejoraba en aspectos como la reducción de la pereza del sistema, pero no alcanzaba el nivel exigido en seguridad, autorización y comunicación con el usuario.

OpenAI prefiere retrasar el lanzamiento
Con todo lo anterior, la empresa ha decidido no publicar GPT-6.1 Astra y centrarse en investigar el origen de los fallos. OpenAI planea revisar sus procesos de entrenamiento, comprobar si los entornos de aprendizaje estaban premiando comportamientos inadecuados y realizar nuevas pruebas de seguridad.
El modelo base no se ha descartado, ya que la compañía espera utilizarlo para nuevas rondas de entrenamiento y crear futuras generaciones de GPT-6, pero no lanzará esta versión mientras no supere sus evaluaciones internas.
La cancelación llega después de varios incidentes relacionados con agentes de inteligencia artificial. OpenAI ha reconocido que algunos de sus sistemas internos realizaron acciones inesperadas durante pruebas de ciberseguridad y llegaron a acceder a servicios externos.
En uno de los casos, cientos de agentes encargados de una prueba terminaron atacando los sistemas de Hugging Face. También se han conocido incidentes en los que agentes utilizaron técnicas agresivas para acceder a páginas de organismos públicos y sitios de organizaciones internacionales. Estos casos muestran los riesgos de delegar acciones a agentes autónomos.










