Un nuevo inteligencia artificial (IA) modelo utilizó un enfoque novedoso de la cognición en IA para reducir drásticamente el costo de las solicitudes, lo que sugiere que el razonamiento no verbal podría ser el siguiente paso hacia que las máquinas desarrollen una inteligencia similar a la humana.
En un nuevo artículo de investigación publicado el 10 de agosto en el servidor de preprints arXiv, científicos de la empresa de IA Pathway detallaron las bases técnicas de su nuevo modelo BDH-CQ. Esto sigue a un modelo precursor conocido como “Dragon Hatchling” que los científicos crearon en 2025, diseñado para simular con precisión cómo se conectan y fortalecen las neuronas del cerebro durante la experiencia de aprendizaje.
En el nuevo estudio, los científicos describieron cómo evaluaron el rendimiento de BDH-CQ frente a un referente fundamental de 2019 que ayudó a fijar el estándar actual para medir el progreso hacia la AGI (inteligencia artificial general): ARC-AGI, el punto en el que la IA ha igualado o sobrepasa las capacidades humanas en todos los dominios.
El referente de 2019, conocido como ARC-AGI, utiliza rompecabezas de razonamiento no verbal —como girar una serie de figuras para completar una secuencia— para medir la capacidad cognitiva de los sistemas de IA. Mientras que los humanos son sumamente hábiles para inferir las reglas de este tipo de acertijos mediante ensayo y error, los primeros sistemas de IA históricamente eran mucho menos hábiles.
BDH-CQ obtuvo casi un 30% en el referente ARC-AGI-1, resolviendo con éxito el equivalente a tres de diez rompecabezas en dos intentos o menos. Aunque numerosos modelos han logrado puntuaciones significativamente mejores en esta prueba, el enfoque de razonamiento subyacente en BDH-CQ hace que su tamaño y los costos de uso sean drásticamente menores que los de modelos construidos sobre la arquitectura tradicional basada en transformadores.
Por ejemplo, mientras el modelo de razonamiento ligero de nivel de entrada de OpenAI GPT 5.6 Luna (Low) obtuvo una puntuación ligeramente más alta, el estudio señala que esta «ganancia modesta de precisión» costó aproximadamente 11 veces más que BDH-CQ en términos de costos relativos por tokens —el sistema de medición que las empresas de IA utilizan para medir el costo de ejecutar sistemas de IA. Este tipo de arquitectura de modelo de IA, si se adopta ampliamente, podría tener un impacto drástico en el costo total y la escalabilidad de los despliegues de IA, sostienen los científicos.
Más de lo que parece
BDH-CQ fue entrenado con apenas 150 millones de parámetros, mientras que los parámetros de los modelos de IA más avanzados y de frontera, como Llama 3 70B o Llama 3.1 405B de código abierto de Meta, normalmente alcanzan decenas de miles de millones a cientos de miles de millones. En el mundo del desarrollo de IA, menos parámetros significa que los modelos se entrenan más rápido y se ejecutan más baratos.
Sin embargo, los investigadores señalaron que estos resultados también implican que las capacidades de cognición del modelo podrían escalar de manera significativa al ampliarse a tamaños de parámetros mayores.
La razón de este salto de rendimiento es que el modelo de Pathway utiliza lo que los científicos de la empresa describen como una arquitectura post-transformer.
La mayoría de los modelos de IA convencionales, como los que alimentan Claude y ChatGPT, se basan en modelos transformer, llamados así porque transforman las entradas del usuario en puntos de referencia matemáticos interconectados. Estos sistemas revisan cada palabra dentro de una entrada de forma simultánea, lo que les permite inferir el contexto a partir de la posición, tal como decidir, basándose en palabras cercanas, si la palabra «bark» se refiere a perros o a árboles.
Un modelo transformer forma sus respuestas a partir de mirar la solicitud completa al mismo tiempo y luego predecir cuál debería ser la siguiente palabra en la secuencia de su respuesta. Lo hace palabra por palabra, usando lenguaje natural para verbalizar de manera efectiva una cadena de pensamiento lineal en segundo plano. El razonamiento de los transformers también funciona de forma secuencial, lo que significa que deben atravesar cada etapa de un problema en un orden lineal estricto.
Estos modelos tienen ventajas significativas sobre arquitecturas anteriores, que a menudo olvidaban el inicio de una entrada cuando llegaban al final. Sin embargo, las arquitecturas transformer pueden enfrentar dificultades con indicaciones más largas o complejas, ya que la complejidad computacional de evaluar la indicación aumenta cuadráticamente —lo que significa que duplicar la longitud de una entrada utiliza cuatro veces más potencia de procesamiento.
El uso de modelos de IA se mide por token, con un token representando cualquier fragmento de datos (aproximadamente cuatro caracteres de texto) que la IA tiene que ingerir o generar. Debido a que las indicaciones más complejas requieren pensamientos más prolongados con múltiples pasos, el procesamiento y la respuesta a estas consultas puede consumir una cantidad significativa de tokens.
¿La próxima generación de la IA?
La generación convencional basada en transformadores para la generación de tokens tiende a provocar cuellos de botella de memoria, ya que la IA relee cada palabra anterior en la conversación con cada nueva palabra generada. Con el tiempo, esto terminará saturando la memoria de las unidades de procesamiento gráfico (GPUs) utilizadas para operaciones de IA.
Por ello, escalar el razonamiento de IA se ha convertido en un desafío computacional costoso. El enfoque post-transformer de Pathway cambia la forma en que la IA almacena y procesa los recuerdos de una conversación y la relación entre piezas de información. Reemplaza los registros de texto con herramientas nuevas, incluida una memoria a corto plazo mejorada y un mecanismo que le permite trabajar en problemas sin consumir tokens.
Los modelos basados en transformers retienen indicaciones y historiales de interacción como una larga cadena de valores numéricos que representan el texto de las solicitudes. Esa cadena se expande a medida que se añaden nuevos tokens al procesar la solicitud. BDH-CQ utiliza matrices numéricas para representar las reglas subyacentes y los patrones contextuales de una tarea, usando números para rastrear las relaciones entre fragmentos de información en lugar de definirlas en texto.
Estas matrices representan vectores —información direccional que apunta a otro punto en un mapa teórico almacenado dentro de la memoria de la GPU como parte de los datos de entrenamiento, implantados durante la creación del modelo. Los científicos señalaron en el estudio que esto permite al modelo procesar razonamiento abstracto complejo sin aumentar su huella de memoria ni el costo computacional.
Para ejecutar tareas, BDH-CQ implementa un mecanismo de razonamiento latente como su espacio de trabajo interno. Usando números para representar los diferentes elementos de una indicación o problema, realiza una serie de bucles recurrentes iterativos para determinar la mejor respuesta a devolver basada en la indicación. El modelo toma la salida del último ciclo, evalúa cómo podría mejorarse el resultado basándose en sus datos de entrenamiento y alimenta la salida anterior como punto de partida para la siguiente iteración. Se repite esto durante un número predefinido de ciclos, y cada iteración teóricamente se acerca más al resultado deseado.
Para abordar problemas más complejos que requieren más tiempo de pensamiento, BDH-CQ puede ejecutar más ciclos. Esto aumenta el tiempo empleado, pero la cantidad de memoria y potencia computacional consumidas no se escala con más intentos —en teoría, el modelo consumiría una porción constante de memoria y energía al ejecutar 200 ciclos como al ejecutar 20 ciclos. Los modelos estándar basados en transformadores, por el contrario, obtienen más tiempo de pensamiento generando largas cadenas de tokens de texto escrito, lo que consume la memoria de las GPUs y la potencia de cómputo en un clúster de IA de forma exponencial.
Los resultados del ARC-AGI-1 del modelo han sido verificados y reproducidos de forma independiente por investigadores destacados en el campo de la IA, incluido el investigador de NYU, Richard Zhong, y Łukasz Kaiser, coautor del influyente artículo de 2017 “Attention Is All You Need”, que introdujo el concepto de transformadores dentro de los modelos de lenguaje grandes.
“He seguido de cerca a Pathway y he reproducido mis propios resultados ARC-AGI-1”, dijo Kaiser en una declaración. “Pathway demuestra que la arquitectura del modelo, no solo la escala, puede impulsar el próximo salto en el razonamiento de IA.”
Pathway planea escalar la arquitectura BDH hasta 600 mil millones de parámetros y aplicar su razonamiento basado en vectores a pruebas más desafiantes, como ARC-AGI-2 y ARC-AGI-3, así como desarrollar un modelo de lenguaje grande (LLM) plenamente funcional basado en la tecnología, lo que proporcionaría una base para construir chatbots basados en texto. La empresa espera que la tecnología pueda aplicarse a problemas de razonamiento complejos en sectores como la respuesta a incidentes de ciberseguridad y operaciones industriales.