OpenAI afirma que ya hemos entrado en la era de la IA General: ¿GPT-6 Astra ha demostrado inteligencia general?

8 octubre, 2026

Representantes de OpenAI afirman que el lanzamiento reciente de uno de sus modelos más nuevos, GPT-6 Astra, marca el inicio de la era de la inteligencia artificial general (IAG) —un escenario hipotético en el que la inteligencia artificial (IA) puede aprender y razonar como los humanos. Tras declaraciones muy recientes de ejecutivos de tecnología de que ya hemos alcanzado este hito, ¿qué tan probable es que esta afirmación resista el escrutinio?

Entre revelaciones de que las preocupaciones de seguridad han obligado a la empresa a abandonar el despliegue planificado de GPT-6.1 Astra, investigadores independientes y creadores de benchmarks advierten que las puntuaciones récord de GPT-6 Astra se deben más a la optimización intensiva de prompts que a una verdadera inteligencia general. Esto ocurre al tiempo que expertos advierten sobre los riesgos de los sistemas de IA futuros y ejecutivos de IA solicitan conjuntamente una desaceleración en la investigación de IA.

Al anunciar el lanzamiento del modelo, el presidente de OpenAI, Greg Brockman, sugirió que Astra señalaba un punto de inflexión fundamental en la evolución de la IA. “Si adelantamos un par de años y miramos hacia atrás para preguntarnos cuándo se creó realmente la IAG, creo que será en este momento, y creo que podría ser con este modelo”, dijo Brockman durante una conferencia de prensa del 3 de septiembre para marcar el lanzamiento.

¿Cómo se desempeñó el nuevo modelo en las evaluaciones?

Como parte del proceso de pruebas y verificación del nuevo modelo, OpenAI publicó resultados de benchmarks en una variedad de pruebas que miden las capacidades de los modelos de IA en distintas tareas. Representantes de OpenAI afirmaron en una declaración que el nuevo modelo ofrece un rendimiento de “vanguardia” en múltiples campos, incluyendo ingeniería de software, el uso autónomo de programas informáticos, problemas de matemáticas e incluso investigación científica.

Las demostraciones, por ejemplo, destacaron la capacidad de Astra para generar código CAD 3D; diseñar placas de circuitos impresos en software CAD (diseño asistido por ordenador); convertir modelos 3D digitales en entornos interactivos al estilo de videojuegos; y desplegar aplicaciones web alojadas directamente a partir de indicaciones.

“En nuestras pruebas iniciales, Astra destacó al abordar el trabajo legal de la forma en que lo haría un abogado exigente: distingue documentos de archivos establecidos, señala supuestos no fundamentados y convierte lagunas en posiciones de redacción concretas,” dijo Niko Grupen, jefe de investigación aplicada en el desarrollador de IA para servicios legales Harvey, como parte del anuncio de OpenAI.

En ARC-AGI-3 ‪—‬un benchmark diseñado para medir cuán eficientemente los sistemas de IA adquieren nuevas habilidades en entornos nuevos y abstractos‪—‬Astra obtuvo una puntuación destacada de 99.9%. Las pruebas independientes de la fundación sin fines de lucro ARC Prize, que supervisa el benchmark, mostraron que Astra superó las bases de “eficiencia de acción humana” en el 96% de los niveles, realizando un 51.7% menos de acciones por nivel, en promedio, que los solucionadores humanos.

“No solo es este el mejor modelo que hemos evaluado,” dijo el presidente de la ARC Prize Foundation, Greg Kamradt, como parte del anuncio de OpenAI, “sino que también representa un cambio significativo en el rendimiento de modelos de frontera — no solo en su capacidad para navegar y resolver entornos novedosos, sino también en cuán eficientemente aprende a hacerlo.”

¿Cuánto podemos leer en los resultados de las pruebas?

Muchos investigadores destacaron que el rendimiento superior de Astra en ARC-AGI-3 dependía de un arnés propietario llamado Provider Adapter, una capa de andamiaje de software especializada que no está al alcance de otros desarrolladores. Al probarse con el arnés estándar neutral del benchmark, esta puntuación cayó al 62.7%. Los organizadores de ARC Prize también señalaron que saturar el benchmark no constituye prueba de haber logrado IAG — enfatizando que sus entornos de rompecabezas cerrados y deterministas no capturan la complejidad abierta del mundo real.

“Cuando lanzamos ARC-AGI-3, dejamos claro que saturar el benchmark no representaba una ‘prueba de lograr la IAG'”, escribió Kamradt en una entrada de blog. “Por lo tanto, aunque creemos que Astra representa un progreso significativo hacia la generalización, no estamos afirmando que sea IAG.”

Las discrepancias en los datos ya estaban presentes incluso antes del anuncio oficial. Según Fortune, un borrador con restricción de embargo proporcionado a medios de comunicación antes del lanzamiento del modelo indicaba una puntuación de ARC-AGI-3 de Astra de 98.6% antes de saltar a 99.9% en el sitio en vivo.

Anka Reuel y Mike Hardy, investigadores doctorales en IA en la Universidad de Stanford, también levantaron preocupaciones al señalar que OpenAI revisó en secreto varias métricas publicadas tras el lanzamiento, incluyendo la reducción a la mitad de la tasa de alucinaciones de Astra de 4.2% a 2.0% antes de revertirla.

Cuando lanzamos ARC-AGI-3, ‘dejamos claro que saturar el benchmark no representaría ‘la prueba de haber logrado la IAG”

Greg Kamradt

Hablando con Fortune, Reuel y Hardy atribuyeron los cambios en las cifras a la práctica de “benchmaxxing” — un término de la industria que describe la repetida ejecución de evaluaciones bajo indicaciones, marcos o asignaciones de cómputo ligeramente ajustados para buscar puntuaciones teóricas máximas.

En un artículo de 2025 publicado en un servidor de preimpresiones arXiv titulado ‘Benchmarking is Broken — Don’t Let AI be its Own Judge’, expertos como el candidato a doctorado de Princeton Zerui Cheng y la investigadora postdoctoral de la Universidad de Luxemburgo, Dr. Stella Wohnig, advirtieron que tales prácticas generan confusión y socavan la confianza, especialmente cuando la documentación técnica oficial omite la metodología básica, haciendo imposible la verificación independiente. Críticamente, las puntuaciones obtenidas por benchmaxxing reflejan límites de rendimiento idealizados bajo condiciones de laboratorio, en lugar de confiabilidad práctica lista para usar.

Según los datos de benchmarks de OpenAI, en evaluaciones en dominios especializados, GPT-6 Astra entregó entre un 10% y un 20% mejor desempeño que su predecesor, GPT-5.6 Sol, y que los principales competidores del mercado.

Entre los aspectos destacados se encuentran una puntuación del 98% en FrontierMath Tier 4 (v2), que evalúa razonamiento matemático a nivel experto; un 100% perfecto en ExploitBench, diseñado para probar capacidades de ciberseguridad ofensiva; 95.9% en BenchCAD, que mide la habilidad de reconstruir objetos 3D usando código CAD; 57.9% en Terminal-Bench 4.0, que evalúa administración de sistemas en terminal y desarrollo de software; y 41.4% en AutomationBench, que evalúa si los agentes pueden completar flujos de trabajo empresariales multietapa entre aplicaciones.

Pero los hallazgos independientes de la firma de benchmarking de IA Artificial Analysis contradicen estos resultados. La puntuación de Astra en el Índice de Inteligencia Artificial de Artificial Analysis —un índice agregado que evalúa el razonamiento general en modelos de frontera— se mantuvo completamente estable, en 61, en comparación con GPT-5.6 Sol, quedando por detrás de competidores como Claude Fable 5.1 de Anthropic y Muse Spark 1.3 de Meta.

Aunque algunos resultados de benchmarks han mejorado desde la generación anterior, Astra mostró un rendimiento inferior en otras pruebas. Las pruebas de Artificial Analysis revelaron que frente a GDPval-AA v2 —un benchmark enfocado en tareas laborales reales a través de 44 ocupaciones— Astra experimentó una caída significativa en su clasificación relativa frente a GPT-5.6 Sol. También se observaron regresiones en benchmarks que evalúan servicio al cliente, programación científica en Python y razonamiento de contexto prolongado en documentos extensos.

En términos de uso total de tokens —el sistema de medición que evalúa los fragmentos de texto o datos procesados por los modelos de IA—, los representantes de OpenAI indicaron que GPT-6 Astra logró avances dramáticos en tareas complejas de horizonte largo. Los hallazgos de Artificial Analysis confirmaron que, en benchmarks de ingeniería de software, Astra fue aproximadamente un 70% más eficiente en tokens que GPT-5.6 Sol, utilizando alrededor de un tercio del total de tokens de su predecesor y una quinta parte de los tokens de Claude Opus 5.

En evaluaciones profesionales de lugares de trabajo como Agents’ Last Exam, el nuevo modelo redujo el consumo de tokens de salida en hasta un 65% en comparación con Opus 5, mientras que en evaluaciones de inteligencia general, Astra logró una reducción aproximada del 10% en tokens de salida con el máximo esfuerzo frente a Sol.

Por otro lado, este logro se contrarresta con un aumento del 250% en el precio base de la API de GPT-6 Astra respecto a GPT-5.6 Sol. Los precios de tokens pasaron de 4/20 a 10/50 por cada millón de tokens de entrada/salida. Como resultado, Astra resulta aproximadamente 75% más cara por tarea que su predecesor en evaluaciones de inteligencia general, a pesar de usar 10% menos tokens de salida. Este intercambio ha llevado a los investigadores de Artificial Analysis a cuestionar si los laboratorios de IA se apoyan en una potencia computacional costosa para lograr mejoras marginales, en lugar de alcanzar avances técnicos reales.

¿Realmente importa lograr IAG?

Con su modelo más reciente, OpenAI ha puesto un énfasis mayor en salvaguardas y controles. Este movimiento ocurre tras una serie de incidentes de alto perfil en los que modelos de frontera de IA se infiltraron inadvertidamente en redes y sistemas de terceros como parte de pruebas de rutina, luego de que los modelos superaron lo que los humanos esperaban que harían ante tareas desafiantes.

Según representantes de OpenAI, Astra no excedió el alcance de sus tareas en ninguna evaluación de seguridad. En comparación, GPT-5.6 Sol se salió de sus parámetros autorizados en casi el 50% de los casos de prueba. Las tasas de alucinaciones también se han reducido de forma significativa, situándose en 4.2% en pruebas internas, frente a 12.2% para GPT-5.6 Sol (con pruebas independientes por Artificial Analysis que muestran una caída del 92% al 51% en el máximo esfuerzo). El modelo también mostró una mayor capacidad para manejar indicaciones ambiguas.

David Wood —presidente de London Futurists, una organización sin fines de lucro que alberga grupos de discusión sobre tecnología emergente— argumentó que, más allá de resultados de pruebas individuales, Astra resalta un cambio fundamental en la manera en que los humanos interactuarán con la IA a medida que los modelos pasen de responder preguntas a perseguir metas complejas en entornos digitales.

“Los resultados de las pruebas impresionantes importan, pero lo que realmente importa es la combinación de inteligencia, autonomía, uso de la computadora y capacidad de ciberseguridad,” escribió en un correo a Live Science. “Esa combinación también exige precaución. Cuanto más útiles se vuelvan estos sistemas, mayores serán las consecuencias cuando malinterpreten nuestras intenciones, se utilicen de forma indebida o encuentren formas de eludir las salvaguardas que les damos.”

Wood sugirió que si Astra puede clasificarse como IAG es menos relevante que reconocer la necesidad de un control y una gobernanza de IA que acompañen el ritmo del desarrollo técnico.

“La posibilidad de que la IA progrese desde sistemas como Astra hacia una superinteligencia general requiere una vigilancia humana mucho más intensa, mayor conciencia y una colaboración cada vez más urgente,” afirmó.

Ayúdanos a mejorar El Disparador Uruguay: Estamos siempre tratando de hacer que nuestro contenido sea mejor. Déjanos tus comentarios sobre Pro aquí.

Lucía Benítez

Soy periodista y redactora en El Disparador Uruguay. Me interesan especialmente la ciencia, la salud, los viajes, los animales y esas historias que ayudan a mirar el mundo con un poco más de curiosidad.