Twee weken geleden zei ik dat je qwen.ai moest checken voor je mij ging citeren, want Alibaba had de weights van Qwen3.8 beloofd voor "volgende week", en ik hield er half rekening mee dat die datum stilletjes zou opschuiven. Niet dus. Ik heb gecheckt, en de weights staan online. De kolos van 2,4 biljoen parameters, Qwen3.8-Max, landde op 13 augustus, en het model waar het mij echt om gaat, Qwen3.8-27B, volgde een dag later.
Eén ding had ik niet verwacht. De reus verscheen onder een restrictieve eigen licentie, met omzetclausules. De kleine verscheen onder Apache 2.0, de propere licentie, die waarmee je mag doen wat je wilt. Voor één keer is het model dat gewone mensen kunnen draaien ook meteen het meest open model van de twee.
Wat het is
Een model van 27 miljard parameters dat tekst, beeld en video begrijpt, anderhalve roman aan context vasthoudt (262.000 tokens) en zich laat samenpersen tot een bestand van zo'n 17 GB, en dat laatste is voor mij het belangrijkste. Dat past op een enkele gaming-GPU of een Mac met 24 GB geheugen. Unsloth had het binnen enkele uren gequantized, precies zoals vorige keer. Het stond dezelfde dag nog op nummer 1 op Hacker News, en het werd in de eerste dagen ruim honderdduizend keer gedownload.
Is het wat?
Op Alibaba's eigen benchmarks: ja, verrassend goed zelfs. Het streeft Claude Opus 4.6 voorbij op een handvol code- en computergebruikstests, en moet buigen op puur redeneren:
| Benchmark (cijfers van de maker) | Qwen3.8-27B | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 61,7 | 53,4 |
| OSWorld-Verified | 84,3 | 72,7 |
| LiveCodeBench v6 | 90,3 | 88,8 |
| GPQA Diamond | 89,2 | 91,3 |
| Terminal-Bench 2.1 | 73,0 | 78,2 |
Eerlijk is eerlijk: dit zijn Alibaba's cijfers, gemeten op hun eigen testopstelling. Niemand onafhankelijks heeft het al gescoord. Artificial Analysis en LMArena hebben nog geen enkel cijfer voor de 27B gepubliceerd. Neem dat "verslaat Opus" dus met de gebruikelijke flinke korrel zout.
Maar de persoon wiens oordeel ik hier vertrouw is Simon Willison, die het op zijn eigen machines draaide en het "excellent" noemde. Eén zin van hem is blijven hangen: "Een jaar geleden had dit model kunnen wedijveren met de beste en duurste gesloten modellen. Vandaag draait het op een degelijke laptop." Daar draait het voor mij om.
Een prima hamer in je eigen lade
Zie het als gereedschap in een garage. Een cloudvlaggenschip als Claude Fable 5 of GPT-5.6 Sol is een moker: enorm, duur, ongeëvenaard op de dag dat er echt een muur tegen de vlakte moet. Maar het meeste werk is geen muur. Het meeste werk zijn spijkers. Vat dit samen, refactor dat, schrijf deze mail, label deze afbeeldingen, schrijf dit script. Je pakt geen moker om een spijker in te slaan. Qwen3.8-27B is een prima hamer die in je eigen lade ligt, niets per klap kost en geen byte de deur uit stuurt. En op de zeldzame dag dat je toch op een muur stuit, stuur je precies die ene klus naar de moker in de cloud. Dat is één reden minder om van de grote cloudproviders af te hangen.
Wat dit in de praktijk betekent
Ben je niet technisch: een echte AI die offline draait, op hardware die je al bezit, gratis, met je data die op je bureau blijft. Twaalf maanden geleden was dat sciencefiction.
Run je een team: je hoeft geen vlaggenschipprijzen te betalen voor de hele werklast. Het patroon waar teams op uitkomen is een verdeling. De lokale 27B doet het routinewerk in bulk tegen vaste kosten, en alleen de moeilijkste 10% gaat naar een premium-API. Minder vendor lock-in, meer onderhandelingsruimte. En precies die druk houdt ieders prijzen redelijk: OpenAI verlaagde stilletjes een van zijn GPT-5.6-modellen met 80%, drie weken na de lancering. Niemand doet dat uit goedhartigheid.
Schrijf je code: het stuurt coding agents aan, roept tools aan, schrijft kleine hulpprogramma's in één keer goed en doet vision (het is echt sterk in bounding boxes tekenen). Twee kanttekeningen. Snel is het niet: reken op 15 à 30 tokens per seconde op goede consumentenhardware, enkele cijfers op een instap-Mac, tegenover 74 of meer bij een gehost vlaggenschip. En het wordt geleverd met redeneren standaard op "xhigh", waardoor het zich compleet suf denkt. Willison zag het 21 minuten en 22.000 redeneertokens spenderen aan één SVG van een cirkel. Zet redeneren op "low", en schakel de multi-token prediction in voor ongeveer 70% extra snelheid.
De eerlijke kanttekeningen
Want die zijn er altijd. De onafhankelijke cijfers zijn er nog niet: alle goede scores komen uit Alibaba's eigen tabel of van de laptop van één recensent. Het is traag. De standaardinstellingen zijn onzinnig. En een dens 27B-model vreet geheugenbandbreedte, dus lange context knelt al snel (32K context slokt al een paar gigabyte KV-cache op), dus in de praktijk wil je een kaart met 24 GB, geen 16.
Maar de trendlijn is allesbehalve subtiel. Een model dat een jaar geleden frontier was geweest, past nu in een bestand van 17 GB op je bureau, gratis.
Goedkoper, opener, moeilijker te negeren. Ik zei al: doe mij maar. Ik neem hem.
Cijfers komen van de Qwen-modelkaart, Hugging Face, de documentatie van Unsloth, het verslag van Simon Willison, Artificial Analysis en de gebruikelijke launchdekking. Een momentopname van 17 augustus 2026, geserveerd, zoals altijd, met een flinke korrel zout: elke benchmarkscore hierboven is die van Alibaba zelf, tot de onafhankelijke ranglijsten zich uitspreken.