Een DeepSeek-distill op je eigen machine draaien kon al langer, en de kleine versies waren nooit de interessante. Het nieuwe is dat de volledige DeepSeek-V4-Flash, 284 miljard parameters, nu op 22 tot 25 tokens per seconde decodeert op een pc met één RTX-kaart en flink wat systeem-RAM, het soort machine dat net zo goed in een gamekamer als op kantoor staat. De tool heet FreeToken, twee weken geleden uitgebracht door een team van Berkeley en UT Austin, gratis en open source, en elke RTX uit de 30-, 40- of 50-serie wordt ondersteund, een 3090 uit 2020 incluis. Wie verder gaat, draait er GLM-5.2 mee, een model van 753 miljard parameters, op één workstation-GPU, en een 35B mixture-of-experts op bruikbare snelheid op een laptopkaart van 8 GB.
Als die cijfers standhouden (ze komen van de auteurs zelf, daarover verderop meer), is de VRAM-muur tussen frontier-modellen en hardware die je gewoon kunt kopen net een stuk opgeschoven, en is de nieuwe generatie grote open modellen thuis draaien geen kunststukje meer.
Sindsdien staat mijn feed vol "FreeToken vs Ollama"-posts, en de meeste slaan de plank mis: deze tools concurreren niet met elkaar. Ollama serveert modellen, LM Studio is een GUI, Unsloth Studio traint modellen, en FreeToken is een nieuwe engine voor één specifieke, lastige klus.
Dat het me bezighoudt, komt door Kimi K3. Een maand geleden downloadde ik de weights puur om ze op een plank te leggen: het eerste open-weight model in de frontier-top 3, maar het thuis draaien vroeg een supernode van 64 GPU's en een goed gesprek met de netbeheerder. Die kant gaan de grote open modellen al het hele jaar op: gratis te downloaden, onmogelijk te draaien. FreeToken is de eerste tool die de andere kant op duwt, dus laten we uitzoeken wat het echt is, en wat niet.
Vier tools, vier taken
Ollama is de standaardkeuze voor developers: één commando en er draait een model achter een OpenAI-compatibele API op je machine. MIT-licentie, 88 miljoen aan durfkapitaal, naar eigen zeggen 8,9 miljoen maandelijkse developers met 14 werknemers, en sinds kort een betaalde cloudlaag voor de modellen die je GPU niet aankan. Het draait modellen. Het traint ze niet, en het is niet eens de snelste manier om ze te draaien.
LM Studio is de desktop-app: door Hugging Face bladeren, downloaden, chatten, serveren. Gesloten broncode, maar sinds midden 2025 gratis voor commercieel gebruik. Op Apple Silicon is de MLX-engine echt vlot: een onafhankelijke benchmark dit voorjaar mat 102 tokens per seconde waar Ollama er 70 haalde op dezelfde M4 Pro. Dit is degene die ik bij een niet-developer zou installeren.
Unsloth Studio is het buitenbeentje, en voor mij de interessantste taak van de vier: fine-tuning zonder code. Kies een basismodel, sleep er een dataset in, kijk naar de loss-curve, exporteer een GGUF. Sinds maart in bèta, van de YC-startup van twee broers wier bibliotheek 8 miljoen keer per maand wordt gedownload op Hugging Face. Trainen vraagt een NVIDIA-kaart; een 4090 is een comfortabele ondergrens voor een 8B-model.
FreeToken is een onderzoeksengine voor één probleem: mixture-of-experts-modellen die veel groter zijn dan je VRAM. Alleen NVIDIA, Linux en Windows, Apache 2.0, zo'n twee weken oud. De auteurslijst deed me rechtop zitten: Ion Stoica en Matei Zaharia, de mensen achter Spark, Ray en vLLM.
FreeToken met Ollama vergelijken is een prototype-racemotor met een bestelbus vergelijken. In allebei zit een motor. Daar houdt de overlap zo'n beetje op.
Naast elkaar
| Ollama | LM Studio | Unsloth Studio | FreeToken | |
|---|---|---|---|---|
| De taak | modellen lokaal serveren | GUI + lokale server | no-code fine-tuning | enorme MoE's draaien |
| Sinds | 2023 | 2023 | maart 2026 | augustus 2026 |
| Licentie | MIT | proprietary, gratis voor werk | kern Apache 2.0, UI AGPL | Apache 2.0 |
| Platforms | Win/Mac/Linux | Win/Mac/Linux | Win/Linux, Mac deels | Win/Linux, alleen NVIDIA |
| Fine-tuning? | nee | nee | ja | nee |
| Zwakke plek | trager dan kale llama.cpp | gesloten code | bèta, geen Mac-training | jong, ongeverifieerde cijfers |
Wat FreeToken anders doet
Mixture-of-experts-modellen activeren maar een paar experts per token: het rekenwerk is licht, maar elke expert moet wel bereikbaar blijven in het geheugen. FreeToken meet bij de eerste start de PCIe- en CPU-bandbreedte van je machine, en verdeelt het werk daarna over GPU, CPU en systeem-RAM in de verhouding die jouw specifieke bak aankan. En zonder kwaliteitstrucs: de uitvoer van de experts blijft tot op de bit identiek.
Tegenover de gevestigde tools zijn de geclaimde winsten reëel: GLM-5.2, die van 753B, decodeert op zo'n 15 tokens per seconde op één GPU van 96 GB waar llama.cpp op 7 blijft steken, en Qwen3.6-35B haalt 39,3 op een laptop-GPU van 8 GB, zo'n 92% van wat een desktop-4090 haalt.
Het cijfer dat ik het interessantst vind, is geen van die twee. Het is de staartlatentie: hun slechtste beurt bleef onder de 44 seconden, tegen ruwweg vier minuten voor llama.cpp en drie voor Ollama. Wie een coding agent op een lokaal model zet, weet dat daar alles om draait, want agents breken beurten af die blijven hangen. FreeToken levert zelfs een commando mee dat het rechtstreeks aan Claude Code en zijn neefjes knoopt.
Welke is voor jou
Als je code schrijft: Ollama blijft de standaard-backend, vooral omdat alles ermee integreert. Wil je de laatste 10 tot 25% snelheid, ga dan een verdieping lager naar llama.cpp zelf.
Als je gewoon met een model wilt chatten, of op een Mac zit: LM Studio. Inmiddels gratis voor werk, snel op Apple Silicon, en FreeToken draait überhaupt niet op Macs.
Als je een model wilt dat jouw data kent: Unsloth Studio is de enige van de vier die dat doet. Fine-tuning was een week Python; het is nu een avond klikken. Voor juridische of medische data die niet in de buurt van een API mag komen, is dat een echte doorbraak.
Als je een dikke NVIDIA-kaart hebt en de hele dag een coding agent draait: FreeToken is degene om in de gaten te houden. Het is de enige tool hier die gebouwd is om een frontier-model de hele dag op je eigen bureau te laten draaien.
De eerlijke kanttekeningen
Elk FreeToken-cijfer hierboven is gemeten door de auteurs zelf, en het project is twee weken oud, dus onafhankelijke bevestiging is er nog niet. Eén paradepaardje overleeft een kritische lezing nu al niet: de "2,4x sneller" uit het paper zet een end-to-end-cijfer naast pure decode-cijfers, en appels met appels is het eerder 1,3x. Op kleine dense modellen doet llama.cpp al niet onder. En er is geen Mac-support, geen multi-GPU, geen GGUF, en het kernteam telt zo'n drie mensen.
De anderen hebben hun eigen kanttekeningen. Unsloth Studio is bèta, en de UI valt onder AGPL, wat telt als je hem in een commercieel product wilt inbouwen. Ollama forkte zijn eigen engine weg van llama.cpp en haalde daarmee bugs terug die stroomopwaarts al gefikst waren, na eerst een jaar lang llama.cpp nergens te vermelden. LM Studio heeft gesloten broncode, en daar lig je wakker van of niet.
Waar ik uitkom
Mijn hot take, met lichte hand: FreeToken het product wint waarschijnlijk niet, FreeToken de ideeën wel. Open source heeft de gewoonte om slimme trucs over te nemen in de tools die iedereen al gebruikt, en ik verwacht dat llama.cpp binnen een jaar bandbreedtebewust met experts omgaat. Prima. Dat de ideeën vrij zijn, is precies het punt, en de naam zegt het al: de hele belofte bestaat uit tokens waar je niet voor betaalt, op hardware die je al bezit.
In juli schreef ik dat de open weights de betaalde vlaggenschepen hadden ingehaald, en dat alleen de hardwarerekening ze nog uit onze woonkamers hield. Die rekening is deze maand niet verdwenen, maar ze kromp sneller dan ik had verwacht. De K3-kopie op mijn plank start misschien ooit nog op. Toekomstige ik en de netbeheerder zijn deze week allebei een tikje optimistischer.
Gebaseerd op het FreeToken-paper (arXiv 2608.16157) en de GitHub-repo, de Series B-aankondiging van Ollama en de berichtgeving van TechCrunch, de changelog van LM Studio, de documentatie van Unsloth, een Apple Silicon-benchmark van asiai.dev en een sceptische analyse van Cloud Codes over de framing van het paper. Een momentopname van 25 augustus 2026. Elke FreeToken-benchmark is door de auteurs zelf gemeten en bij publicatie niet geverifieerd, en sterrenaantallen, prijzen en versienummers verouderen snel, dus check de repo's voor je me citeert.