← SCRAM AI Lab
OpenAI presentó GPT-6 Astra el 4 de septiembre de 2026 como su modelo "más inteligente y alineado", con rollout escalonado y sin precio publicado. Separamos lo confirmado de los rumores (1M de contexto, benchmarks saturados) y explicamos cómo evaluarlo sin romper tu producto.
September 10, 2026
73 lecturas

GPT-6 Astra es el modelo que OpenAI presentó el jueves 4 de septiembre de 2026 como "el modelo de IA más inteligente y alineado del mundo". La empresa dijo que obtuvo puntuaciones perfectas o casi perfectas en benchmarks clave de razonamiento, que supera a GPT-5.6 Sol y a Claude Fable 5, y que estará disponible para el público general "en los próximos días" tras un lanzamiento inicial con un grupo limitado de organizaciones. Eso es lo que reportó Al Jazeera con base en el anuncio. Precio, ventana de contexto y disponibilidad exacta por API no aparecen en esa cobertura.
En las 72 horas siguientes al anuncio aparecieron cifras muy precisas en sitios de terceros. Antes de ponerlas en una diapositiva, conviene saber de dónde sale cada una.
| Afirmación | Fuente | Estatus |
|---|---|---|
| Anunciado el 4 de septiembre; rollout escalonado; "más inteligente y alineado" | Anuncio de OpenAI vía Al Jazeera | Confirmado |
| Supera a GPT-5.6 Sol y a Claude Fable 5 en benchmarks de razonamiento | Anuncio de OpenAI vía Al Jazeera | Confirmado, sin cifras |
| Ventana de contexto de 1M tokens | Yotta Labs | Tercero, no verificado |
| FrontierMath Tier 4 98%, ARC-AGI-3 99.9%, ExploitBench 100% | Yotta Labs | Tercero, no verificado |
| Disponible en ChatGPT, API, Azure y Bedrock | Releasebot | Agregador, pendiente de confirmar |
| Precio por millón de tokens | Nadie | No publicado al 10 de septiembre |
Nuestra regla en el laboratorio: una cifra sin fuente primaria no entra al enrutador ni a un presupuesto. Entra a una lista de "por verificar".
Porque el contexto de septiembre de 2026 es distinto al de los lanzamientos anteriores. En julio, un ataque dirigido por IA comprometió a una startup alojada en Hugging Face; el 31 de agosto Anthropic publicó el seguimiento a sus propios incidentes de acceso no autorizado. En Estados Unidos, el senador Bernie Sanders y el representante Greg Casar promueven una ley que pausaría el desarrollo de IA avanzada. Y académicos como Toby Walsh (UNSW) y Roman Yampolskiy (Universidad de Louisville) cuestionaron en la misma cobertura si las capacidades crecen más rápido que la capacidad de entenderlas y controlarlas. OpenAI respondió dedicando una parte grande del anuncio a seguridad, aunque sin detallar mecanismos concretos en lo que se ha publicado.
Lo que esto significa para una empresa en México o Latinoamérica: el proveedor de modelos va a cambiar políticas de uso, límites y clasificadores con más frecuencia. Tu integración tiene que aguantar que una llamada que ayer pasaba hoy sea rechazada por una salvaguarda nueva. Si no tienes circuit breaker y reintentos con degradación, este es el trimestre para ponerlos.
Con un plan de dos semanas y una regla: el modelo nuevo no toca producción hasta que gane en tu propio conjunto de pruebas, no en el benchmark del proveedor. Así lo hacemos nosotros con cada modelo de frontera.
Nada precipitado. Septiembre trae dos modelos de frontera nuevos y un cambio de precio en Sonnet 5 ($3/$15 desde el 1 de septiembre). Nuestra postura es que la frontera cotidiana sigue siendo Opus 5 por precio de entrada ($5 por millón), y que Fable 5.1 y GPT-6 Astra compiten por el 10% de turnos difíciles. Ese 10% se decide con datos propios, no con el titular. Para el resto, la anatomía de un enrutador por niveles que publicamos sigue vigente: modelo barato por defecto, escalamiento por señal, y un modelo de frontera como último recurso.
En cuanto OpenAI publique precio y acceso por API, corremos GPT-6 Astra contra Fable 5.1 y Opus 5 en nuestros 120 turnos y publicamos los tres números: calidad, costo por turno resuelto y p95. Si alguna cifra de terceros resulta cierta, la marcaremos como confirmada; si no, la quitamos de la tabla. Es la única forma honesta de cubrir un lanzamiento que llega con más adjetivos que números.
Artículos relacionados
Cómo evaluamos un modelo nuevo antes de ponerlo frente a un cliente: el juez, 120 turnos y el enrutador
Septiembre trajo Fable 5.1 y GPT-6 Astra. Nuestro método para decidir si un modelo entra al asistente de SCRAM: un juez automático que califica cada turno, una muestra de 120 conversaciones reales etiquetadas por una persona, tres métricas y un enrutador por niveles. Con la historia del juez que borraba su propio rastro.
Kimi K3, GLM-5.3 y DeepSeek V4-Flash: la frontera abierta de agosto 2026
Kimi K3, GLM-5.3 y DeepSeek V4-Flash redefinen la IA open-weight en agosto 2026: comparativa de costos, licencias MIT, hardware y adopción técnica en LATAM.
GLM-5.2: la apuesta de Z.ai por 1M de contexto para agentes de coding
GLM-5.2 introduce un millón de tokens de contexto para coding agéntico. Analizamos su arquitectura, comparativa de costos y aplicabilidad en empresas de LATAM.