Zes dagen lang was het meest gebruikte AI-model op OpenRouter een model waar niemand zijn naam op wilde zetten. Het dook op 20 augustus op als "Ox Alpha": geen bedrijf, geen prijs, gratis voor iedereen, een contextvenster van 1 miljoen tokens, beeld en video als invoer, en verdacht goed in code. Een half miljoen mensen stortte zich erop, ik ook, en het internet speelde een week lang detective. Vandaag trok Z.ai het masker af: Ox Alpha is GLM-5.3-Flash, MIT-gelicentieerd, en de volledige weights staan nu al op Hugging Face.
Het houdt me bezig omdat ik het ding live de ranglijsten zag leegvreten, en omdat de onthulling eindelijk antwoord geeft op de enige vraag die er echt toe doet: wat kost dit nu het niet meer gratis is?
De week van de gratis tokens
Tegen de tijd dat het masker afging, waren de cijfers niet meer normaal. Ox Alpha werkte in zijn eerste 72 uur zo'n 11,6 biljoen tokens weg, ongeveer tweeënhalf keer de grootste lancering die OpenRouter ooit zag. Het stootte DeepSeek na een reeks van 56 dagen van de eerste plek op OpenCode. Op de dag van de onthulling stond de teller op ruwweg 44 biljoen tokens en een half miljoen gebruikers. Allemaal gratis, en precies daarom kwam iedereen opdagen.
Het speurwerk was het leukste deel. Binnen twee dagen draaiden mensen vingerafdruktests tegen het model: eigenaardigheden van de tokenizer, een API-foutcode die alleen bij GLM-5.3 hoort, exact de redeneerinstellingen van de GLM-familie. Elke test wees naar Z.ai, het lab uit Peking achter de GLM-modellen, terwijl de wildere theorieën (Google, Microsoft, zelfs SpaceX-rekenkracht, vraag me niet hoe) de tijdlijn vermakelijk hielden. Dus toen Z.ai het vanochtend aan Bloomberg bevestigde, was de reactie minder verbazing en meer "zeiden we toch". De nerds hadden de juiste verdachte binnen 48 uur te pakken.
Wat het precies is
GLM-5.3-Flash is een mixture-of-experts-model van 320 miljard parameters dat er per token maar 18 miljard activeert, en zo blijft het goedkoop om te draaien. Het accepteert tekst, beeld en video, houdt een contextvenster van 1 miljoen tokens vast, en het geheel, zo'n 328 GB aan weights, staat onder MIT-licentie op Hugging Face. Commercieel gebruik inbegrepen, zonder addertjes. Z.ai zegt bovendien dat de hele stealth-periode op Chinese chips draaide, wat een eigen artikel waard is als het standhoudt.
Dan de prijslijst: 0,15 dollar per miljoen input-tokens, 0,50 dollar per miljoen output, en tot 9 september de helft daarvan dankzij de lanceringskorting. Ter vergelijking: Claude Opus 4.8 rekent 5 en 25 dollar. Dat is ruwweg 30 keer goedkoper aan de inputkant en 50 keer aan de outputkant, tegen het volle tarief, voor een model dat in een vergelijkbare codeklasse speelt. Zelfs Gemini 3.7 Flash, het budgetmodel van Google, kost vijf tot zeven keer meer.
Is het wat?
Eerlijk antwoord: heel goed voor de prijs, en niet het nieuwe beste model. Je feed zal roepen dat het "Claude en OpenAI wegvaagt". Dat klopt niet. De virale 80% op DeepSWE kwam uit een test van tien taken door één ontwikkelaar, die er zelf op terugkwam na het draaien van de volledige set. Hier is Z.ai's eigen vergelijkingstabel, dus cijfers van de verkoper, vet markeert de winnaar:
| Benchmark | GLM-5.3-Flash | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 84,3 | 85,0 | 87,4 | 85,8 |
| DeepSWE v1.1 | 63,4 | 58,0 | 69,6 | 65,3 |
| AutomationBench | 48,8 | 41,0 | 37,2 | 52,3 |
Lees die tabel eerlijk en het beeld is duidelijk: het geeft Claude Opus 4.8 partij en blijft meestal achter op GPT-5.6 Terra en Gemini 3.7 Flash. Het enige onafhankelijke cijfer dat we hebben is de Intelligence Index van Artificial Analysis, waar het 57 scoort, gelijk met Terra en een punt boven Gemini 3.7 Flash, en die tests draaiden ze zelf. Z.ai zegt zelfs openlijk dat het niet meedoet met de absolute top, Claude Fable 5 of GPT-5.6 Sol. Dus nee, er is vandaag niemand onttroond. Wat veranderde, is wat dit niveau model kost.
De proeverijstand
Het draaiboek hier is de proeverijstand in de supermarkt. Zet het product neer zonder etiket, deel het gratis uit, en tel hoeveel mensen terugkomen voordat je het merk en de prijs verklapt. OpenRouter heeft zulke standjes vaker gehost: GPT-4.1 draaide proef als "Quasar Alpha", GPT-5 als "Horizon". Het verschil is dit keer de schaal. Z.ai deelde voor 44 biljoen tokens aan proefhapjes uit, voerde anoniem de ranglijsten aan, en draaide pas daarna het bordje om, om te laten zien dat het product een fractie kost van alles wat ernaast in het schap staat. Als lancering valt daar weinig tegen in te brengen. (De winkel zelf wisselde vorige week trouwens van eigenaar, maar dat was de vorige post.)
Wat dit in de praktijk betekent
Als je code schrijft: zet het in je routing en test het op je eigen repo's zolang de korting loopt. Tegen 0,075 dollar per miljoen input-tokens kost je eigen evaluatie bijna niets, en je eigen evaluatie is meer waard dan elke tabel hierboven. Houd een frontier-model achter de hand voor de moeilijke problemen, gebruik dit voor het volume.
Als je een team leidt: de interessante begrotingspost is alles wat op volume draait: samenvatten, extractie, classificatie, interne chat. Diezelfde taken tegen een dertigste van de prijs, dat is een echt budgetgesprek. De keerzijde is governance: de gehoste API loopt via Chinese infrastructuur en Z.ai staat op een Amerikaanse exportzwartelijst, dus alles wat gevoelig is blijft bij een westers gehoste aanbieder, of gaat op de zelf gehoste weights, die MIT zijn en zonder gedoe.
Als je niet technisch bent: de kern is dat de prijs van "goed genoeg AI" opnieuw hard is gezakt. Functies die vorig kwartaal te duur waren om te draaien, vragen stellen over al je documenten, een assistent per gebruiker, transcripties opschonen, worden stilletjes betaalbaar. Reken op meer daarvan in de producten die je al gebruikt.
De eerlijke kanttekeningen
Elk cijfer in die tabel is Z.ai dat zijn eigen huiswerk nakijkt, een paar uur oud en niet gereproduceerd; de enige onafhankelijke score is die 57. De kop van 44 biljoen tokens is opgeblazen door caching, want volgens OpenCode kwam zo'n 93% van de input-tokens uit de cache. Een gratis week vertelt je wat mensen pakken als het gratis is, niet wat ze ervoor betalen. De korting stopt op 9 september. En zelf hosten vraagt "maar" zo'n 328 GB geheugen, oftewel één zeer serieuze server in plaats van je game-pc, al draaien gekwantiseerde versies inmiddels op een Mac Studio met 256 GB.
Het masker aftrekken was leuk, maar het getal dat in mijn hoofd blijft hangen is geen benchmark. Het is dat een model dat Claude Opus partij geeft nu per miljoen tokens minder kost dan een koffie. De top van de markt bewoog vandaag niet. De vloer wel.
Cijfers uit het lanceringsmateriaal van Z.ai en de Hugging Face-modelkaart, de OpenRouter-pagina, het onthullingsartikel van Bloomberg, het publieke dashboard van OpenCode en de onafhankelijke indexrun van Artificial Analysis. Een momentopname van 26 augustus 2026, enkele uren na de aankondiging: elke benchmark behalve de score van Artificial Analysis komt van de verkoper zelf, dus houd de korrel zout binnen handbereik tot er onafhankelijke metingen liggen.