26 août 2026 · 7 min de lecture

Ox Alpha était GLM-5.3-Flash depuis le début, et c'est le prix qui compte

Pendant six jours, le modèle d'IA le plus utilisé sur OpenRouter était un modèle que personne ne voulait signer. Il est apparu le 20 août sous le nom « Ox Alpha » : pas d'entreprise, pas de prix, gratuit pour tout le monde, une fenêtre de contexte d'un million de tokens, des images et de la vidéo en entrée, et étonnamment doué en code. Un demi-million de personnes s'y sont ruées, moi compris, et Internet a passé la semaine à jouer les détectives. Aujourd'hui, Z.ai a retiré le masque : Ox Alpha, c'est GLM-5.3-Flash, sous licence MIT, avec les poids complets déjà disponibles sur Hugging Face.

Ça me concerne parce que je l'ai regardé avaler les classements en direct, et parce que la révélation répond enfin à la seule question qui compte vraiment : combien coûte cette chose maintenant qu'elle n'est plus gratuite ?

La semaine des tokens gratuits

Au moment où le masque est tombé, les chiffres ne ressemblaient plus à rien. Ox Alpha a englouti environ 11 600 milliards de tokens dans ses 72 premières heures, à peu près deux fois et demie le plus gros lancement jamais vu sur OpenRouter. Il a délogé DeepSeek de la première place sur OpenCode après un règne de 56 jours. Le jour de la révélation, le compteur affichait environ 44 000 milliards de tokens et un demi-million d'utilisateurs. Le tout gratuit, et c'est exactement pour ça que tout le monde est venu.

L'enquête, c'était la partie amusante. En deux jours, des gens ont lancé des sondes d'identification contre le modèle : bizarreries du tokenizer, un code d'erreur API propre à GLM-5.3, les réglages de raisonnement exacts de la famille GLM. Toutes les sondes pointaient vers Z.ai, le labo pékinois derrière les modèles GLM, pendant que les théories plus folles (Google, Microsoft, même du calcul SpaceX allez savoir comment) animaient les fils de discussion. Alors quand Z.ai l'a confirmé à Bloomberg ce matin, la réaction tenait moins de la surprise que du « on vous l'avait dit ». Les passionnés tenaient le bon suspect en 48 heures.

Ce que c'est, concrètement

GLM-5.3-Flash est un modèle mixture-of-experts de 320 milliards de paramètres qui n'en active que 18 milliards par token, et c'est comme ça qu'il reste bon marché à faire tourner. Il accepte texte, images et vidéo, tient une fenêtre de contexte d'un million de tokens, et l'ensemble, environ 328 Go de poids, est sous licence MIT sur Hugging Face. Usage commercial compris, sans conditions. Z.ai affirme aussi que toute la phase furtive a tourné sur des puces fabriquées en Chine, ce qui mérite son propre article si ça se confirme.

Puis la grille tarifaire : 0,15 $ par million de tokens en entrée, 0,50 $ en sortie, et moitié moins jusqu'au 9 septembre avec la remise de lancement. Pour comparer, Claude Opus 4.8 facture 5 $ et 25 $. Soit environ 30 fois moins cher en entrée et 50 fois en sortie, au tarif plein, pour un modèle qui joue dans une catégorie de code comparable. Même Gemini 3.7 Flash, l'offre économique de Google, coûte cinq à sept fois plus.

Et il vaut quoi ?

Réponse honnête : très bon pour le prix, mais pas le nouveau meilleur modèle. Votre fil d'actualité vous dira qu'il « écrase Claude et OpenAI ». C'est faux. Le score viral de 80 % sur DeepSWE venait d'un test de dix tâches mené par un seul développeur, qui l'a lui-même relativisé après avoir lancé la série complète. Voici le tableau comparatif de Z.ai, donc des chiffres du vendeur, le gras marquant le gagnant :

Benchmark GLM-5.3-Flash Claude Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
Terminal-Bench 2.1 84,3 85,0 87,4 85,8
DeepSWE v1.1 63,4 58,0 69,6 65,3
AutomationBench 48,8 41,0 37,2 52,3

Lisez ce tableau honnêtement et la forme est claire : il rend coup pour coup à Claude Opus 4.8 et reste le plus souvent derrière GPT-5.6 Terra et Gemini 3.7 Flash. Le seul chiffre indépendant dont on dispose, c'est l'Intelligence Index d'Artificial Analysis, où il obtient 57, à égalité avec Terra et un point au-dessus de Gemini 3.7 Flash, tests menés par leurs soins. Z.ai dit d'ailleurs ouvertement ne pas viser le tout premier rang, Claude Fable 5 ou GPT-5.6 Sol. Donc non, personne n'a perdu sa couronne aujourd'hui. Ce qui a changé, c'est le prix de ce niveau de modèle.

Le stand de dégustation

La recette ici, c'est le stand de dégustation du supermarché. Vous posez le produit sans étiquette, vous le distribuez gratuitement, et vous comptez combien de gens reviennent avant de leur donner la marque et le prix. OpenRouter a déjà accueilli ce genre de stand : GPT-4.1 s'est testé sous le nom « Quasar Alpha », GPT-5 sous « Horizon ». La différence cette fois, c'est l'échelle. Z.ai a distribué pour 44 000 milliards de tokens d'échantillons, a dominé les classements incognito, puis seulement là a retourné la pancarte pour montrer que le produit coûte une fraction de tout ce qui l'entoure en rayon. Comme lancement, difficile de faire mieux. (Le magasin lui-même a changé de mains la semaine dernière, mais c'est le billet précédent.)

Ce que ça change en pratique

Si vous écrivez du code : ajoutez-le à votre routage et testez-le sur vos propres dépôts tant que la remise dure. À 0,075 $ le million de tokens en entrée, lancer votre propre évaluation ne coûte presque rien, et votre propre évaluation vaut mieux que tous les tableaux ci-dessus. Gardez un modèle frontière pour les problèmes durs, prenez celui-ci pour le volume.

Si vous dirigez une équipe : la ligne budgétaire intéressante, c'est tout ce qui tourne en volume : résumé, extraction, classification, chat interne. Ces tâches à un trentième du prix, c'est une vraie discussion de budget. Le contrepoids, c'est la gouvernance : l'API hébergée passe par des infrastructures chinoises et Z.ai figure sur une liste noire d'exportation américaine, donc tout ce qui est sensible reste chez un fournisseur hébergé en Occident, ou passe sur les poids auto-hébergés, qui sont MIT et sans ambiguïté.

Si vous n'êtes pas technique : retenez que le prix de l'IA « suffisamment bonne » vient encore de chuter brutalement. Des fonctionnalités trop chères à faire tourner le trimestre dernier, questions-réponses sur tous vos documents, assistants par utilisateur, nettoyage de transcriptions, deviennent discrètement abordables. Attendez-vous à en voir davantage dans les produits que vous utilisez déjà.

Les bémols honnêtes

Chaque chiffre de ce tableau, c'est Z.ai qui corrige sa propre copie, des résultats vieux de quelques heures et non reproduits ; le seul score indépendant, c'est ce 57. Le titre des 44 000 milliards de tokens est gonflé par le cache, puisque OpenCode indique qu'environ 93 % des tokens d'entrée en venaient. Une semaine gratuite vous dit ce que les gens prennent quand c'est gratuit, pas ce qu'ils paieront. La remise s'arrête le 9 septembre. Et l'auto-hébergement ne demande « que » 328 Go de mémoire, c'est-à-dire un très gros serveur plutôt que votre PC de jeu, même si des versions quantisées tournent déjà sur un Mac Studio de 256 Go.

Le démasquage était amusant, mais le chiffre qui me reste en tête n'est pas un benchmark. C'est qu'un modèle qui rend coup pour coup à Claude Opus coûte désormais moins cher au million de tokens qu'un café. Le haut du marché n'a pas bougé aujourd'hui. Le plancher, si.


Chiffres tirés des documents de lancement de Z.ai et de la fiche Hugging Face, de la page OpenRouter, de l'article de Bloomberg sur la révélation, du tableau de bord public d'OpenCode et du test indépendant d'Artificial Analysis. Photographie au 26 août 2026, quelques heures après l'annonce : tous les benchmarks sauf le score d'Artificial Analysis viennent du vendeur, alors gardez les pincettes à portée de main en attendant des mesures indépendantes.