GLM 5.3 Flash: cómo el modelo “stealth” Ox Alpha resultó ser la nueva red de Z.ai
Durante un par de semanas, los desarrolladores estuvieron intentando adivinar qué potente modelo sin nombre había aparecido en OpenRouter bajo el nombre en clave Ox Alpha. El 26 de agosto, la china Z.ai mostró sus cartas: es GLM 5.3 Flash, el primer modelo nativamente multimodal de la serie GLM-5. Veamos qué puede hacer, de dónde salió y si conviene confiarle tus datos.

Durante un par de semanas, los chats de desarrolladores dieron vueltas alrededor de la misma pregunta: ¿qué clase de bestia es este Ox Alpha? El modelo apareció en el catálogo de OpenRouter y en el agente open-source OpenCode sin previo aviso: sin nombre de equipo, sin model card, ni una línea de documentación. De la nada apareció una red potente y, encima, la estaban ofreciendo gratis. La gente la probó en sus propias tareas, compartió capturas, discutió sobre quién la habría creado. El 26 de agosto de 2026, el misterio se cerró: el laboratorio chino Z.ai dio la cara y dijo: sí, somos nosotros, y el modelo se llama GLM 5.3 Flash.
La historia ya es divertida por sí sola, pero detrás hay algo más interesante que el chisme de un lanzamiento anónimo. Vayamos por partes: qué son estos lanzamientos "stealth", cómo la comunidad identificó al autor antes del anuncio, qué puede hacer realmente GLM 5.3 Flash y —lo más importante— si vale la pena cambiarse a él para el trabajo diario.
Por qué lanzar un modelo de forma anónima
La táctica se conoce como lanzamiento "stealth", y durante el último año los laboratorios chinos en particular le han tomado gusto. El esquema es simple: publicas el modelo en alguna plataforma compartida como OpenRouter, pero sin branding, bajo un nombre en clave neutral. Das acceso, muchas veces gratis, y simplemente observas qué pasa.
La idea es conseguir feedback honesto. Cuando la model card dice "un nuevo modelo de un laboratorio famoso", la mitad de la reacción viene cargada de expectativas y reputación, no del modelo en sí. Pero nadie le tiene miedo a un "Ox Alpha" sin nombre y nadie le debe nada: los desarrolladores simplemente lo ponen a trabajar, lo rompen con sus tareas reales y en esos mismos chats escriben dónde brilla y dónde se cae. Para un equipo, es una forma barata de obtener métricas de uso real antes de encender la maquinaria de PR.
Había otra señal que valía la pena mencionar por separado. OpenCode habló de un presupuesto del orden de cien billones de tokens al día, y todo eso se estaba regalando. Nadie quema tanto "solo para probar". Parece que alguien estaba empujando deliberadamente un flujo enorme de solicitudes reales a través del modelo, no un puñado de demos para un anuncio bonito.
Cómo descubrieron al autor antes del anuncio
Lo más interesante es que Z.ai casi no tuvo oportunidad de sorprender a nadie. La comunidad descifró el linaje de Ox Alpha bastante antes del reconocimiento oficial, y no por corazonadas brillantes, sino por pequeñas pistas técnicas.
Primero, el tokenizador. La manera en que un modelo corta el texto en piezas es casi como una huella familiar. El de Ox Alpha coincidía sospechosamente bien con lo que la gente ya había visto en GLM. Segundo, su comportamiento ante temas sensibles: el modelo esquivaba de forma característica las preguntas sobre política china, exactamente como lo hacen los modelos entrenados dentro de China. Súmale ciertos códigos de error de la API que también recordaban a familias conocidas. Por separado, cada pista podría ser casualidad; juntas formaban un "esto viene de uno de los laboratorios frontier chinos, probablemente de la línea GLM" bastante convincente.
Y así fue. El 26 de agosto, Z.ai confirmó que Ox Alpha y GLM 5.3 Flash son el mismo modelo, y junto con eso publicó sus pesos y benchmarks.
Qué es GLM 5.3 Flash
Ahora vamos a lo importante. GLM 5.3 Flash es, en palabras de la propia Z.ai, el primer modelo nativamente multimodal de la serie GLM-5. "Nativamente" es la palabra clave: no le pegaron un reconocedor de imágenes aparte después de entrenarlo; el modelo fue entrenado desde el inicio para manejar distintos tipos de datos como un solo flujo.
Por dentro usa una arquitectura Mixture-of-Experts (MoE). Dicho de forma muy simple: en lugar de una red gigantesca que se activa completa en cada solicitud, el modelo se divide en muchos "expertos" y solo una pequeña parte de ellos se enciende para cada token. Formalmente, GLM 5.3 Flash tiene 320 mil millones de parámetros, pero solo alrededor de 18 mil millones están activos en cada momento. Gracias a eso, el modelo se comporta como algo grande e inteligente, pero cuesta más cerca de algo pequeño. Además, usa atención híbrida sparse-linear, un mecanismo que ayuda a mantener la precisión en contextos muy largos sin disparar la factura de cómputo.
Las características clave, resumidas en una sola lista:
- Contexto — hasta 1 millón de tokens. Literalmente, bases de código completas o documentos enormes cargados de una sola vez.
- Salida máxima — hasta 131,072 tokens de una vez.
- Entrada — texto, imágenes y video.
- Especialización — código y escenarios agénticos: tareas de varios pasos en las que el modelo llama herramientas por su cuenta y lleva el trabajo hasta un resultado.
- Pesos — publicados en HuggingFace bajo licencia MIT. Es decir, el modelo es realmente abierto: puedes descargarlo y ejecutarlo tú mismo.
Vale la pena subrayar el último punto. Una licencia MIT abierta no significa "mira y admira": es permiso para usar el modelo en tus propios productos casi sin restricciones. Para un modelo frontier de este calibre, eso sigue siendo poco común.
Qué tan bueno es
Z.ai reporta sus números en su benchmark interno, Code Bench v1.0. Según ese benchmark, GLM 5.3 Flash "supera claramente" al GLM-5.2 anterior en todos los niveles de dificultad y "rinde a la par" de Claude Opus 4.8 en programación y tareas agénticas. Siempre conviene tomar los benchmarks internos con una buena dosis de escepticismo —los califica el mismo equipo que entrenó el modelo—, pero incluso ajustando por eso, la afirmación es seria. Mantener el ritmo de Opus 4.8 en código es nivel de los mejores modelos occidentales, no de un "gama media sólido".
Y aquí entra la segunda mitad de la historia: el precio. En el proveedor, GLM 5.3 Flash es francamente barato para su categoría:
| Tipo de token | Precio por 1M |
|---|---|
| Entrada | $0.15 |
| Salida | $0.50 |
| Entrada en caché | $0.03 |
En comparación, los modelos occidentales de fuerza similar suelen costar varias veces más, a veces un orden de magnitud más. Esta combinación —"casi como Opus en código, pero al precio de un modelo ligero"— es la razón principal por la que hubo tanto ruido alrededor de Ox Alpha antes de que alguien supiera de quién era.
Cuál es la trampa
No viene completamente libre de advertencias, y lo más honesto es nombrarlas desde el principio.
Primero: privacidad. El proveedor que ofrece el modelo conserva tus prompts y respuestas. Formalmente, no para entrenamiento, pero el hecho sigue ahí: tus solicitudes se almacenan en algún lugar. Para tareas públicas no es un problema, pero secretos de trabajo, correspondencia comercial o datos personales es mejor mantenerlos fuera de un modelo como este.
Segundo: sigue siendo un lanzamiento reciente. Los benchmarks internos se ven muy bien, pero solo las pruebas independientes y meses de uso real darán el panorama completo. Por ahora, conviene tratar al modelo como muy prometedor, pero todavía no curtido por el tiempo.
GLM 5.3 Flash en ChatPlus
Agregamos este modelo cuando todavía estaba en su fase "stealth", bajo el nombre Ox Alpha, y lo actualizamos para el lanzamiento oficial: cambiamos al endpoint actual, corregimos el nombre y los precios. Puedes probarlo ahora mismo: abre un chat con GLM 5.3 Flash. Dos cosas que vale la pena saber:
- El modelo está disponible con la suscripción PRO. Sin vueltas.
- Deliberadamente lo dejamos fuera de la selección automática. Por esa misma historia de que las solicitudes se almacenan del lado del proveedor, no queremos que el modelo se convierta silenciosamente en el predeterminado. Que GLM 5.3 Flash sea una elección deliberada: lo activas cuando sabes por qué.
Se siente como una opción excelente para código y escenarios agénticos largos, sobre todo cuando necesitas un contexto grande y no te importa meter una base de código completa en una tarea. También es una buena excusa para comparar el modelo recién salido de Z.ai con los conocidos GPT, Claude y Gemini en una sola ventana: en ChatPlus, solo tienes que cambiar el modelo en el chat.
En resumen
Ox Alpha resultó no ser un recién llegado misterioso, sino GLM 5.3 Flash: el nuevo modelo multimodal de Z.ai. Es fuerte en código, maneja un millón de tokens de contexto, cuesta centavos para los estándares de su categoría y se distribuye bajo una licencia abierta. En contra: el proveedor almacena tus solicitudes y el modelo todavía es demasiado nuevo para juzgarlo de forma definitiva. Definitivamente vale la pena probarlo: en ChatPlus ya está disponible con la suscripción PRO.
Prueba los mejores modelos de IA en ChatPlus
GPT, Claude, Gemini, GLM y otros modelos de IA en una sola ventana.