Las empresas chinas lleva la delantera en modelos "pequeños" de IA. Ahora lo que quieren es justo lo contrario: modelos colosales
En el dinámico mundo de la inteligencia artificial, China se ha destacado por su liderazgo en el desarrollo de modelos «pequeños» de IA, diseñados para funcionar con menos memoria y capacidad de cálculo, permitiendo su uso en dispositivos más modestos. Sin embargo, las empresas chinas están ahora girando su enfoque hacia el desarrollo de modelos colosales, que prometen revolucionar el campo de la inteligencia artificial a gran escala.
Modelos como Qwen y MiniCPM han posicionado a China como un actor clave en la carrera por la eficiencia en IA. Pero la tendencia está cambiando. Tecnológicas chinas de renombre están apostando por modelos de IA de gran envergadura. Un ejemplo de esta escalada es el DeepSeek-V3, que cuenta con 671.000 millones de parámetros, y el Moonshot AI, que ha llevado a Kimi K2 hasta el billón de parámetros. En 2026, el ritmo se ha acelerado aún más: Kimi K3 alcanza los 2,8 billones, mientras que Alibaba ha situado a Qwen3.8-Max en 2,4 billones de parámetros.
La arquitectura detrás de estos modelos no es completamente nueva. En 2023, se especuló que GPT-4 de OpenAI podría estar utilizando un diseño de Mixture of Experts (MoE), donde solo una parte de los parámetros se activa en cada paso del procesamiento. Qwen3.8-Max, por ejemplo, utiliza alrededor de 95.000 millones de parámetros por paso, a pesar de contar con 2,4 billones en total.
Es importante destacar que el tamaño de un modelo no siempre se traduce en mayor inteligencia o precisión. DeepMind demostró en 2022 que Chinchilla, con 70.000 millones de parámetros, superó a Gopher, de 280.000 millones, en diversas tareas. La arquitectura, junto con la cantidad y calidad de los datos y los recursos de computación, juegan un papel crucial en el rendimiento de un modelo.
El futuro de la IA parece dirigirse hacia modelos aún más grandes. Alibaba ha confirmado que Qwen 4 está en fase de entrenamiento y que sus próximos modelos, Qwen 4.5 y Qwen 5, podrían alcanzar entre 5 y 10 billones de parámetros. ByteDance también estaría persiguiendo una escala similar, según Financial Times, aunque la compañía no ha hecho declaraciones públicas al respecto.
China no busca reemplazar los modelos pequeños por los grandes, sino abarcar ambos extremos del espectro. Los modelos compactos son ideales para aplicaciones que requieren eficiencia en memoria y costos, mientras que los modelos colosales están diseñados para tareas más complejas y variadas, a pesar de requerir una infraestructura más robusta.