Tecnología e inteligencia artificial

¿Ya estamos en AGI?

Mismas preguntas. Un mundo diferente.

LZLuis ZaeraCEO de Zarela

10 min de lectura · Actualizado 8 de septiembre de 2026

Portada de ¿Ya estamos en AGI?
En este artículo

Cada pocos meses el debate vuelve al mismo titular: ¿ya llegó el AGI?

En septiembre de 2026 dejó de sonar a ciencia ficción. Greg Brockman cerró el lanzamiento de GPT-6 Astra con una frase hecha para titular: “Welcome to the AGI era”. Jensen Huang, de Nvidia, fue más directo: “AGI has arrived”.

Dentro de la misma OpenAI, Sam Altman había descrito AGI como un término mal definido y de poco uso. A TIME le dijo que la empresa todavía no estaba del todo ahí, aunque esperaba un sistema interno que él sí llamaría AGI antes de terminar 2026. Mark Chen, chief research officer, habló de “80% del camino”. Yann LeCun insiste en otra cosa: los grandes modelos de lenguaje no tendrían la arquitectura necesaria. François Chollet y ARC Prize validaron un salto enorme de Astra y, al mismo tiempo, dijeron que saturar ARC-AGI-3 no demuestra AGI.

El desacuerdo no es solo de calendario. Es de definición. Y en 2026 aparece una segunda pregunta igual de importante:

¿AGI de qué? ¿Del modelo, del modelo con herramientas, del agente persistente o de un enjambre de agentes?

Este texto reúne lo que se puede contrastar hasta el 8 de septiembre de 2026. No corona un campamento.

En breve

  • No hay una definición única de AGI. OpenAI, DeepMind, ARC Prize y los mercados de predicción están midiendo cosas distintas.
  • Astra cambió el mapa: 95% en ARC-AGI-2 y hasta 99.9% en ARC-AGI-3 con el Provider Adapter. El perfil, aun así, es irregular.
  • El trabajo real se acerca, pero no describe una economía post-AGI. Stanford no ve desplazamiento generalizado. Sí ve una brecha de empleo de 19% entre jóvenes de 22 a 25 años en ocupaciones muy expuestas a IA.
  • Algunos instrumentos de medición se están rompiendo. OpenAI dejó de reportar SWE-bench Verified y estimó que alrededor de 30% de SWE-Bench Pro también estaba roto.
  • Las fechas dependen de la pregunta. Metaculus sitúa una IA general hacia 2032. Un panel LEAP, con un umbral económico mucho más duro, se va a 2047-2050.

¿Qué significa AGI?

La etiqueta suena técnica y única. En la práctica es una familia de umbrales. Dos personas pueden pelear “sí o no” mientras miden objetos incompatibles.

Cuatro umbrales

AGI no es una línea. Son varias.

OpenAI Charter

Sistemas autónomos que superan a humanos en la mayor parte del trabajo valioso.

Hay avances fuertes. No hay una auditoría pública de ese umbral.

Chollet / ARC Prize

Adquirir habilidades nuevas con eficiencia comparable a la humana.

Astra satura ARC-AGI-3 con un harness. ARC Prize dice que eso no prueba AGI.

Yann LeCun

World models, memoria, planificación y mundo físico. Escalar LLM no basta.

Un sistema puede ser muy útil y seguir sin cumplir su criterio.

Norvig / Agüera y Arcas

Generalidad amplia de tareas, lenguajes y modalidades.

Bajo esa lectura, argumentaron que AGI ya estaba aquí en 2023.

Síntesis de marcos públicos. Ninguno de estos criterios es intercambiable.

Cuatro marcos públicos de AGI, con umbrales distintos y lecturas distintas hacia septiembre de 2026.

Un score no resuelve una disputa si la definición cambia entre quienes hablan. Un sistema puede ser extraordinario en matemática y frágil en un flujo de trabajo de varias horas. Puede ganar una comparación profesional y seguir necesitando a alguien que defina el problema.

Por eso, frente a cualquier titular, la primera pregunta útil es otra:

¿Bajo qué definición exacta se está usando “AGI”?

DeepMind lo dice de otra manera. En marzo de 2026 publicó un marco de diez capacidades —percepción, memoria, aprendizaje, razonamiento, cognición social— y reconoció que varias siguen mal medidas. Hassabis, además, ha usado un ejemplo exigente: entrenar un sistema solo con información anterior a 1911 y ver si redescubre algo comparable a la relatividad. El punto no es convertir eso en la definición oficial. Es separar recuperar conocimiento de crear conocimiento nuevo.


¿Qué sistema se está midiendo?

Hasta 2024, “el modelo” era una unidad relativamente clara: un prompt, una respuesta, un puntaje. La frontera de 2026 se parece menos a eso. Un resultado puede incluir razonamiento extra, búsqueda, código, control de computadora, memoria persistente, subagentes y verificadores.

ARC Prize lo dejó en un solo número. Con el Standard harness, Astra obtuvo 62.7% en ARC-AGI-3. Con el Provider Adapter —que conserva estado opaco de razonamiento y compacta el contexto largo— subió a 99.9%. Es el mismo modelo familiar. No es el mismo sistema efectivo.

Modelo vs. sistema

El mismo Astra, dos resultados

Standard harness

62.7%

El modelo decide qué conservar en notas visibles. Interfaz más neutra.

Provider Adapter

99.9%

Conserva estado opaco de razonamiento y compacta el contexto largo.

Fuente: ARC Prize, evaluación de GPT-6 Astra en ARC-AGI-3 Semi-Private, septiembre 2026.

El harness cambia el resultado: 62.7% con la interfaz estándar frente a 99.9% con el Provider Adapter.

Bajo el Adapter, Astra usó menos acciones que la mediana humana en 96% de los niveles. También construyó representaciones simbólicas compactas de entornos nuevos. ARC Prize lo marca igual: el salto es material, el test es cerrado y determinista, y saturarlo no constituye prueba de AGI.

La lección cabe en una línea. El scaffolding puede valer tanto como el modelo.


Lo que dice OpenAI, y lo que no

El Charter de OpenAI define AGI como sistemas altamente autónomos que superan a los humanos en la mayor parte del trabajo económicamente valioso. Eso pide autonomía, superioridad y cobertura económica. Un leaderboard no lo cierra.

La voz pública de la empresa, además, no es una. Altman pasó de escribir en 2025 que OpenAI sabía cómo construir AGI “como tradicionalmente la ha entendido” a tratar la palabra como marketing poco útil. Brockman habló de entrar en una era y, en términos personales, de que ya se podría estar ahí. Chen ofreció un 80% sin publicar la escala. Son juicios de liderazgo, no una métrica reproducible.

La misma semana

Cuatro frases. Cuatro objetos.

Welcome to the AGI era.

Greg Brockman · OpenAI

Todavía no del todo. Y el término está mal definido.

Sam Altman · OpenAI

AGI has arrived.

Jensen Huang · Nvidia

El desacuerdo no es de calendario. Es de arquitectura.

Yann LeCun · New York University

Declaraciones públicas alrededor del lanzamiento de GPT-6 Astra, agosto-septiembre 2026.

Cuatro declaraciones públicas alrededor de Astra. La misma semana no describe el mismo umbral.

El desacuerdo tampoco empieza y termina en OpenAI. LeCun no discute solo el calendario: discute la arquitectura. Chollet puede celebrar a Astra y negar que ARC pruebe AGI. Gary Marcus reconoció un avance real y pidió robustez fuera del test. Dario Amodei prefiere hablar de “Powerful AI”. Andrew Ng, con una definición fuerte —cualquier tarea intelectual humana—, sigue viendo décadas. Jensen Huang declaró que AGI ya llegó. Hay que leer esa frase también sabiendo que Nvidia vende la infraestructura de toda la frontera.

Durante años, además, AGI tuvo peso contractual en el acuerdo Microsoft-OpenAI. En 2026 esa cláusula desapareció. El dato importa porque la palabra llegó a tener consecuencias financieras. No alcanza para atribuir las frases de Altman o Brockman a ese cambio.


Astra: un acantilado, no un promedio

Astra es el motivo por el que la conversación se tensó. OpenAI lo presenta como su modelo más capaz hasta la fecha. Los récords son reales. El perfil completo también.

Satura o casi satura abstracción y ciencia: 99.9% en ARC-AGI-3 con Adapter, 97.6% en FrontierMath Tier 4, 96% en GPQA. En trabajo profesional abierto el suelo cambia: 59.3% en Agents' Last Exam, 41.4% en AutomationBench, 40.9% en tareas internas de data science. Esos porcentajes no son una misma escala. Sí dibujan una frontera dentada.

Perfil jagged

Astra no es un score. Es un acantilado.

ARC-AGI-3 · Provider Adapter
99.9%
ARC-AGI-1
98.5%
FrontierMath Tier 4
97.6%
GPQA Diamond
96.0%
ARC-AGI-2
95.0%
BrowseComp
91.5%
OSWorld 2.0
72.6%
Terminal-Bench Science
64.6%
ARC-AGI-3 · Standard harness
62.7%
Agents' Last Exam
59.3%
Terminal-Bench 4.0
57.9%
Humanity's Last Exam + tools
57.2%
FrontierCode Main
53.3%
AutomationBench
41.4%
Data science (interno)
40.9%

≥ 90% 70–89% < 70%

Fuente: OpenAI, GPT-6 Astra (3 sep. 2026). Los porcentajes no son comparables entre evaluaciones.

GPT-6 Astra satura abstracción y ciencia, y cae por debajo del 60% en evaluaciones de trabajo profesional abierto.

Por eso “superhumano” necesita complemento: ¿en qué capacidad, con qué herramientas, durante cuánto tiempo y bajo qué criterio de éxito?

El 8 de septiembre OpenAI añadió otra señal: un modelo interno, por encima de Astra, y miles de agentes coordinados habrían propuesto una solución al problema de Navier-Stokes. Es una afirmación fuerte de capacidad científica. Al cierre de este texto sigue siendo un anuncio reciente, bajo escrutinio externo, con debate de atribución y prioridad. No es Astra solo. Es un sistema compuesto.


Del benchmark al empleo

Si se toma en serio el Charter, la pregunta no es el examen. Es el trabajo.

GDPval acerca esa medición: 1,320 tareas de 44 ocupaciones, construidas por profesionales. GPT-5.2 Thinking empataba o superaba a expertos en 70.9% de las comparaciones en diciembre de 2025. GPT-5.4 subió a 83% en marzo de 2026. El dato es serio. También es limitado: tareas bien especificadas, esencialmente de un tiro, sin capturar un puesto completo.

Dentro de OpenAI, los agentes de investigación ya producen 3.1 jornadas de agente por cada jornada humana. La empresa habla de un “automated research intern” bajo dirección. El siguiente objetivo declarado es un investigador automatizado para marzo de 2028. El anuncio actual describe un intern supervisado, no un investigador general autónomo.

La economía tampoco ofrece un veredicto limpio. Stanford, con datos de nómina de ADP hasta junio de 2026, no encuentra desplazamiento generalizado. Sí encuentra que el empleo de trabajadores de 22 a 25 años en ocupaciones muy expuestas a IA está 19% por debajo de un contrafactual de pares menos expuestos. El ajuste parece venir sobre todo de menor contratación, no de más despidos.

METR, en 2025, midió otra fricción: desarrolladores experimentados tardaron 19% más usando herramientas de IA en repositorios que ya conocían, aunque creían ir más rápido. En 2026 el propio experimento se volvió demasiado sesgado para estimar el efecto actual. La lección estable es más simple que el titular.

Benchmark, percepción y productividad real no son el mismo objeto.

Trabajo y economía

La frontera se acerca al escritorio. El empleo todavía no se desploma.

GDPval · wins/ties vs expertos

70.9%83.0%

GPT-5.2 · dic. 2025
GPT-5.4 · mar. 2026

OpenAI research

3.1

jornadas de agente por cada jornada humana, a mediados de agosto de 2026. Sigue siendo un intern bajo supervisión.

Empleo 22–25 años · ocupaciones expuestas

−19%

frente a un contrafactual de pares jóvenes en ocupaciones menos expuestas. No hay desplazamiento generalizado.

Fuentes: OpenAI GDPval (dic. 2025 y mar. 2026); OpenAI Research acceleration (6 sep. 2026); Stanford Digital Economy Lab (ago. 2026).

GDPval pasa de 70.9% a 83.0%. OpenAI reporta 3.1 jornadas de agente por jornada humana. Stanford estima una brecha de empleo de ~19% entre jóvenes en ocupaciones expuestas a IA.

Cuando el metro se rompe

Un segundo problema de 2026 es que no todos los scores sobreviven una auditoría.

Crisis de medición: no todo benchmark sigue midiendo bien.

En febrero, OpenAI dejó de reportar SWE-bench Verified. En una auditoría de 138 problemas, encontró fallos materiales en 59.4% de los casos y señales de contaminación. Recomendó pasar a SWE-Bench Pro. Cinco meses después estimó que alrededor de 30% de ese segundo test también estaba roto y retiró su propia recomendación.

La industria mejora más rápido que algunos de sus instrumentos. Un número alto puede significar que el modelo avanzó, que el examen se filtró o que el metro se quedó corto.


Si la fecha cambia, la pregunta también

Los forecasts son especialmente sensibles a la definición utilizada.

Futuros divergentes: el horizonte cambia con la definición.

Metaculus sitúa su pregunta de “general AI” alrededor de septiembre de 2032. No es el consenso científico. Es un mercado de predicción con reglas propias.

El panel LEAP usa un umbral mucho más duro: superar al percentil 90 humano en ocupaciones no físicas, en al menos 90% de las tareas útiles, a un costo de inferencia no mayor a cinco veces el trabajo humano. Bajo esa definición, la mediana cae en 2050 para expertos y 2047 para superforecasters. La misma gente, preguntada por tareas de software de ocho horas, se va a 2028-2030.

La distancia entre 2028 y 2050 no es necesariamente incoherencia. Mide la diferencia entre automatizar un dominio y superar al percentil 90 en casi toda la economía no física.

Un último contrapeso: en la encuesta de AAAI 2025, 76% de 475 encuestados consideró improbable que escalar los enfoques actuales baste para AGI. Es una muestra concreta, no “el 76% de todos los investigadores del mundo”.


Entonces, ¿ya estamos?

Hay varias respuestas internamente coherentes. Dependen de qué se esté pidiendo.

, si AGI significa una inteligencia digital amplia, multimodal y útil en muchos dominios. Esa lectura encaja con Brockman, Huang y el argumento temprano de Norvig.

Estamos entrando, si AGI es una era y no un día. Un modelo concreto puede no satisfacer cada definición, y el conjunto de capacidades ya se siente históricamente distinto.

Casi, pero no, si se exige autonomía larga, aprendizaje continuo y cobertura real del trabajo económico. Ahí el Charter sigue abierto.

No, si se pide inteligencia general humana en el sentido de Chollet, Marcus o LeCun: robustez abierta, world models, comprensión física, transferencia fuera del test.

La pregunta binaria es el problema, si se acepta la ironía de 2026: el CEO de OpenAI duda de la utilidad del término mientras su presidente anuncia la era AGI.

Para no adoptar un campamento de entrada, basta con cuatro filtros. Pedir la definición. Pedir la unidad de análisis: modelo, herramientas, agente persistente, multiagente o humano en el loop. Mirar el peor borde, no solo el récord. Buscar evidencia externa cuando el claim sale del propio laboratorio.

El salto de 62.7% a 99.9% al cambiar el harness, y el uso de miles de agentes en investigación matemática, muestran por qué esa unidad ya no es opcional. La inteligencia que se está evaluando no vive necesariamente dentro de un único modelo.

Los datos de septiembre de 2026 permiten decir que la frontera cambió. No obligan a una sola etiqueta. La conclusión —ya estamos, estamos entrando, estamos cerca, todavía no— queda en quien lee.


Mientras el debate de AGI sigue abierto, el trabajo cotidiano no espera.

Zarela es software local para facturar, cobrar, controlar inventario y ver el negocio en un solo flujo. Prueba 15 días.

Fuentes y referencias

Nota editorial

Las cifras de laboratorios, las auditorías independientes, los estudios laborales y los forecasts no son intercambiables. Navier-Stokes se describe aquí como un anuncio reciente, todavía bajo escrutinio.

Definiciones y evaluaciones. OpenAI Charter. Levels of AGI (Morris et al., 2023). Chollet, On the Measure of Intelligence. ARC Prize sobre Astra. DeepMind, marco cognitivo (2026). Norvig y Agüera y Arcas, 2023.

Voces y resultados de OpenAI. TIME, 26 ago. 2026. Axios sobre Astra. GPT-6 Astra. Research acceleration. The Verge sobre el acuerdo Microsoft-OpenAI. Jensen Huang. LeCun en Brown.

Trabajo, medición y forecasts. GDPval. GPT-5.2. GPT-5.4. METR, 2025. Stanford Digital Economy Lab. SWE-bench Verified. SWE-Bench Pro. LEAP Wave 8. Metaculus. AAAI 2025. Navier-Stokes, OpenAI.