Las claves verificadas
- Z.ai confirmó que Ox Alpha era una prueba anónima previa de GLM-5.3-Flash. Ver evidencia
- El modelo tiene 320.000 millones de parámetros totales y activa 18.000 millones por token. Ver evidencia
- Los pesos fueron publicados con licencia MIT. Ver evidencia
- Z.ai afirma que reduce 3,01 veces el cálculo de atención y 4,44 veces el caché KV frente a GLM-5.3. Ver evidencia
La identidad detrás de Ox Alpha
Z.ai confirmó que el modelo anónimo Ox Alpha, disponible durante varios días en OpenRouter y OpenCode, era una versión preliminar de GLM-5.3-Flash. La prueba sin marca permitió recopilar uso y opiniones antes del lanzamiento oficial.
También puede servirte: Jalapeño: el primer chip de OpenAI muestra resultados
La empresa asegura que Ox Alpha se convirtió en uno de los modelos más usados de la semana en ambas plataformas. También afirmó que todo ese tráfico fue atendido con aceleradores fabricados en China, una señal relevante dentro de la competencia por reducir la dependencia de hardware estadounidense.
GLM-5.3-Flash ya está disponible mediante API y con pesos descargables. La publicación bajo licencia MIT permite estudiar, modificar y desplegar el modelo, dentro de los términos de esa licencia.
Qué tiene el nuevo modelo de Z.ai
El modelo posee 320.000 millones de parámetros totales, pero utiliza 18.000 millones por token gracias a una arquitectura de expertos. Es el primer integrante nativamente multimodal de la familia GLM-5 y puede trabajar con texto e imágenes.
Z.ai combinó atención dispersa y atención lineal para reducir el costo de los contextos extensos. Según sus mediciones, el cálculo de atención baja 3,01 veces y el tamaño del caché KV disminuye 4,44 veces respecto de GLM-5.3.

La compañía también redujo la cantidad de capas y entrenó el sistema con un corpus multimodal de 30 billones de tokens. Afirma que supera a GLM-5.2 en pruebas y cargas reales, aunque los resultados publicados por el desarrollador requieren validación independiente amplia.
Canal de WhatsApp
¿Querés enterarte cuando pase algo importante?
Alertas y noticias seleccionadas. Sin grupos, sin ruido y gratis.Qué significa que sea abierto y qué exige para usarlo
Pesos abiertos no significa que sea un modelo pequeño. Descargarlo es posible, pero ejecutar 320.000 millones de parámetros exige memoria, almacenamiento y aceleradores muy superiores a los de una computadora personal común, incluso cuando solo se activa una fracción durante cada paso.
La licencia MIT facilita la experimentación y el uso comercial, mientras que la ficha oficial ofrece rutas para Transformers, vLLM, SGLang, Docker y otros entornos. Para la mayoría de los usuarios, la API será más práctica que un despliegue local completo.
El dato de 18.000 millones activos explica parte de la eficiencia, pero no elimina la necesidad de guardar y distribuir el conjunto de pesos. Quien evalúe instalarlo debe mirar cuantización, memoria disponible, velocidad deseada y costo energético, no únicamente la cifra de parámetros activos.
Por qué importa dentro de la carrera de IA
La estrategia de Z.ai combina tres señales: lanzar un modelo competitivo, abrir sus pesos y demostrar que puede servir una carga grande sobre chips chinos. Cada una disputa un frente diferente: capacidades, adopción por desarrolladores y autonomía de infraestructura.
La prueba anónima también ofrece una lectura interesante sobre marca y evaluación. Al ocultar el proveedor, Z.ai buscó que el uso inicial se concentrara en la experiencia. Sin datos públicos completos de satisfacción y errores, la popularidad por sí sola no prueba superioridad técnica.

El próximo examen será la reproducción de benchmarks, la estabilidad en despliegues externos y el costo real fuera de la infraestructura de Z.ai. Por ahora, GLM-5.3-Flash amplía la oferta de modelos abiertos de gran escala y convierte a Ox Alpha en algo más que una curiosidad temporal.
Qué aporta VisteEsto: Nuestro trabajo en esta nota
Separa el lanzamiento comercial, la apertura de pesos y la viabilidad de uso local, evitando equiparar open weights con un modelo liviano.
Fuentes consultadas
- Fuente primariaZ.ai: lanzamiento oficial de GLM-5.3-Flash
- Fuente primariaHugging Face: modelo y licencia MIT
- Fuente secundariaAI Primer: especificaciones y rendimiento
Historial de actualización
- Publicación inicial con el anuncio oficial y la ficha del modelo abierto.
Cómo elaboramos esta nota
Definimos la consulta principal “qué es GLM-5.3-Flash y por qué se llamaba Ox Alpha”, contrastamos los datos con 3 fuentes —2 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.
Canal de WhatsApp



