Las claves verificadas

  • Z.ai confirmó que Ox Alpha era una prueba anónima previa de GLM-5.3-Flash. Ver evidencia
  • El modelo tiene 320.000 millones de parámetros totales y activa 18.000 millones por token. Ver evidencia
  • Los pesos fueron publicados con licencia MIT. Ver evidencia
  • Z.ai afirma que reduce 3,01 veces el cálculo de atención y 4,44 veces el caché KV frente a GLM-5.3. Ver evidencia

La identidad detrás de Ox Alpha

Z.ai confirmó que el modelo anónimo Ox Alpha, disponible durante varios días en OpenRouter y OpenCode, era una versión preliminar de GLM-5.3-Flash. La prueba sin marca permitió recopilar uso y opiniones antes del lanzamiento oficial.

La empresa asegura que Ox Alpha se convirtió en uno de los modelos más usados de la semana en ambas plataformas. También afirmó que todo ese tráfico fue atendido con aceleradores fabricados en China, una señal relevante dentro de la competencia por reducir la dependencia de hardware estadounidense.

GLM-5.3-Flash ya está disponible mediante API y con pesos descargables. La publicación bajo licencia MIT permite estudiar, modificar y desplegar el modelo, dentro de los términos de esa licencia.

Qué tiene el nuevo modelo de Z.ai

El modelo posee 320.000 millones de parámetros totales, pero utiliza 18.000 millones por token gracias a una arquitectura de expertos. Es el primer integrante nativamente multimodal de la familia GLM-5 y puede trabajar con texto e imágenes.

Z.ai combinó atención dispersa y atención lineal para reducir el costo de los contextos extensos. Según sus mediciones, el cálculo de atención baja 3,01 veces y el tamaño del caché KV disminuye 4,44 veces respecto de GLM-5.3.

Logotipo de Zhipu AI, empresa detrás de Z.ai
Z.ai reveló la identidad de Ox Alpha y publicó los pesos del modelo. · Zhipu AI · Fuente · Public domain

La compañía también redujo la cantidad de capas y entrenó el sistema con un corpus multimodal de 30 billones de tokens. Afirma que supera a GLM-5.2 en pruebas y cargas reales, aunque los resultados publicados por el desarrollador requieren validación independiente amplia.

Qué significa que sea abierto y qué exige para usarlo

Pesos abiertos no significa que sea un modelo pequeño. Descargarlo es posible, pero ejecutar 320.000 millones de parámetros exige memoria, almacenamiento y aceleradores muy superiores a los de una computadora personal común, incluso cuando solo se activa una fracción durante cada paso.

La licencia MIT facilita la experimentación y el uso comercial, mientras que la ficha oficial ofrece rutas para Transformers, vLLM, SGLang, Docker y otros entornos. Para la mayoría de los usuarios, la API será más práctica que un despliegue local completo.

El dato de 18.000 millones activos explica parte de la eficiencia, pero no elimina la necesidad de guardar y distribuir el conjunto de pesos. Quien evalúe instalarlo debe mirar cuantización, memoria disponible, velocidad deseada y costo energético, no únicamente la cifra de parámetros activos.

Por qué importa dentro de la carrera de IA

La estrategia de Z.ai combina tres señales: lanzar un modelo competitivo, abrir sus pesos y demostrar que puede servir una carga grande sobre chips chinos. Cada una disputa un frente diferente: capacidades, adopción por desarrolladores y autonomía de infraestructura.

La prueba anónima también ofrece una lectura interesante sobre marca y evaluación. Al ocultar el proveedor, Z.ai buscó que el uso inicial se concentrara en la experiencia. Sin datos públicos completos de satisfacción y errores, la popularidad por sí sola no prueba superioridad técnica.

Parte trasera de un rack de centro de datos
La apertura de pesos no elimina los requisitos de infraestructura para ejecutarlos. · Lawrence Berkeley National Laboratory · Fuente · CC0

El próximo examen será la reproducción de benchmarks, la estabilidad en despliegues externos y el costo real fuera de la infraestructura de Z.ai. Por ahora, GLM-5.3-Flash amplía la oferta de modelos abiertos de gran escala y convierte a Ox Alpha en algo más que una curiosidad temporal.

Qué aporta VisteEsto: Nuestro trabajo en esta nota

Separa el lanzamiento comercial, la apertura de pesos y la viabilidad de uso local, evitando equiparar open weights con un modelo liviano.

Fuentes consultadas

Historial de actualización

  • Publicación inicial con el anuncio oficial y la ficha del modelo abierto.
Cómo elaboramos esta nota

Definimos la consulta principal “qué es GLM-5.3-Flash y por qué se llamaba Ox Alpha”, contrastamos los datos con 3 fuentes —2 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.