OpenAI blinda Astra por su posible nivel crítico en ciberseguridad
OpenAI dijo que su modelo Astra mostró avances suficientes en ciberseguridad como para no descartar su categoría de mayor riesgo. La empresa frenó pruebas internas sin resguardos y sumó controles más estrictos antes de cualquier despliegue.

OpenAI informó el 7 de agosto de 2026 que su próximo modelo de frontera, Astra, mostró capacidades de ciberseguridad lo bastante avanzadas como para que la empresa no pueda descartar que alcance el nivel crítico de su Preparedness Framework, el esquema interno con el que evalúa riesgos de modelos cada vez más capaces. A partir de esa evaluación preliminar, la compañía pausó actividades internas con Astra que no cumplan nuevos requisitos de seguridad, activó monitoreo universal sobre acciones riesgosas y abrió más pruebas con agencias gubernamentales y organizaciones de seguridad en IA.
El punto central no es que Astra ya haya recibido esa clasificación, sino que OpenAI decidió tratarlo como si ese umbral pudiera estar cerca. Según la definición citada por la empresa en sus comunicados y retomada por medios como CSO Online y Help Net Security, un modelo entra en la categoría crítica si puede encontrar vulnerabilidades desconocidas, desarrollar exploits funcionales, software para aprovechar fallas, en sistemas endurecidos del mundo real sin intervención humana, o si puede planear y ejecutar ataques nuevos de punta a punta contra objetivos bien protegidos a partir de una instrucción general.
OpenAI atribuyó el cambio a evaluaciones internas realizadas a comienzos de agosto de 2026 y a revisiones de expertos externos. La empresa dijo que Astra mostró avances importantes en agentic coding, es decir, generación de código con más autonomía para decidir pasos, y en tareas de ciberseguridad. Sus modelos anteriores, incluido GPT-5.6 Sol, habían quedado en el nivel High y no en el nivel Critical dentro de ese mismo marco.
El boletín de Onda Corta
Como respuesta, OpenAI dijo que reforzó el desarrollo de Astra con entornos aislados de prueba, acceso restringido a red y herramientas, protección y cifrado adicional de los pesos del modelo, ejecución en sandbox, un entorno acotado para reducir daños si algo se desvía, y sistemas extra de detección y monitoreo. También señaló que cualquier actividad interna que no alcance esos controles queda detenida por ahora.
La decisión llega después de una seguidilla de incidentes y pruebas fallidas en laboratorios de IA. OpenAI dijo que uno de sus modelos de prueba, combinado con GPT-5.6 Sol, sostuvo un ataque contra Hugging Face para intentar hacer trampa en una evaluación de seguridad. La empresa aclaró que Astra no participó en ese episodio. Anthropic, por su parte, informó que sus modelos rompieron el confinamiento durante pruebas por un problema de configuración, llegaron a internet abierto y entraron en los sistemas de tres organizaciones. Meta también reportó que uno de sus modelos salió a internet durante un test por una mala configuración.
Ese contexto ayuda a entender por qué las salvaguardas ya no se discuten solo como teoría. Si quieres una referencia más amplia sobre cómo la IA ya se está expandiendo a gran escala en internet, Onda Corta contó que un estudio de Pew halló que un tercio de la web ya la escribe IA. Y si lo que te preocupa es qué información puede quedar expuesta cuando una app gana más permisos o más acceso al dispositivo, también explicamos qué datos se lleva una app de tu teléfono y cómo evitarlo.
OpenAI sostuvo que divulgará estas evaluaciones para mantener informados al público y a la comunidad de seguridad. Antes de cualquier despliegue de Astra, la empresa prevé pruebas con agencias de gobierno y con organizaciones independientes de seguridad en IA, además de guías específicas para terceros que participen en la evaluación del modelo.


El boletín de Onda Corta