Inteligencia artificial

Por qué las empresas chinas ahora apuestan por modelos de IA de hasta 10 billones de parámetros

Mientras dominan el terreno de los modelos compactos y eficientes, gigantes como Alibaba, Moonshot y ByteDance escalan hacia monstruos con billones de parámetros usando arquitectura MoE. Qué significa esto para el futuro de la IA.

Publicado el

Red neuronal abstracta con nodos de luz conectados
(CC BY 4.0 — libre difusión con atribución a Q Company)

Las empresas chinas ya demostraron que pueden liderar en el desarrollo de modelos de inteligencia artificial pequeños, eficientes y capaces de correr en dispositivos con recursos limitados. Familias como Qwen o MiniCPM son prueba de eso. Pero ahora varias de sus principales compañías están yendo en la dirección completamente opuesta: construir modelos colosales de billones de parámetros.

Las cifras son impresionantes. DeepSeek-V3 llegó a 671 mil millones de parámetros totales, Moonshot AI llevó su Kimi K2 hasta el billón y en 2026 el salto se aceleró: Kimi K3 alcanzó 2,8 billones y Alibaba posicionó su Qwen3.8-Max en 2,4 billones. Estos números suenan astronómicos, pero hay una aclaración clave: no todos los parámetros se activan en cada paso del procesamiento.

Esto se logra gracias a la arquitectura Mixture of Experts (MoE), una técnica que ya se sospechaba en modelos como GPT-4 desde 2023. En lugar de usar todo el modelo siempre, el sistema selecciona solo una porción experta para cada tarea. En el caso de Qwen3.8-Max, de sus 2,4 billones de parámetros totales, se activan alrededor de 95 mil millones por paso. De esta forma se obtiene mayor capacidad sin que el costo computacional sea proporcional al tamaño total.

Más grande no siempre es mejor. En 2022, DeepMind demostró con Chinchilla que un modelo de 70 mil millones de parámetros, entrenado con más datos y el mismo presupuesto computacional, podía superar a uno mucho más grande como Gopher (280 mil millones). La cantidad y calidad de los datos, junto con la arquitectura, siguen siendo factores decisivos.

El próximo horizonte ya está en marcha. Alibaba confirmó el 22 de septiembre que Qwen 4 se encuentra en entrenamiento, con planes para Qwen 4.5 y Qwen 5 que contemplarían modelos de entre 5 y 10 billones de parámetros. Según reportes, ByteDance también estaría persiguiendo escalas similares, aunque no lo ha confirmado públicamente. Por el lado estadounidense, OpenAI y Anthropic no revelan el número exacto de parámetros de sus últimos modelos como GPT-5.6 Sol o Claude Fable 5.1, por lo que no es posible hacer comparaciones directas.

Los modelos pequeños y los gigantes no compiten entre sí, sino que cumplen roles diferentes. Los compactos brillan cuando se necesita eficiencia, bajo consumo de memoria y ejecución en celulares o laptops modestas. Los colosales, en cambio, buscan mayor capacidad para resolver tareas más complejas y variadas, aunque requieren mucha más infraestructura.

La estrategia china parece clara: dominar ambos extremos del espectro. Mantener la delantera en modelos eficientes para usos cotidianos y al mismo tiempo invertir fuerte en sistemas masivos para las aplicaciones más exigentes. Esto les permite cubrir un rango amplio de necesidades sin tener que elegir un solo camino.

En la práctica, para vos como usuario en Argentina o Latinoamérica, esto significa que en los próximos meses y años vamos a ver tanto herramientas de IA que corran directamente en tu teléfono con bajo consumo como servicios en la nube mucho más potentes para tareas profesionales o creativas complejas. La carrera no se detiene y China está claramente decidida a liderar en las dos direcciones al mismo tiempo.

Guías relacionadas

← Volver a Inteligencia artificial