19 juli 2026 · 9 min leestijd

Nieuw seizoen, nieuwe uitdager: Kimi K3 verschijnt open-weight

Om de paar maanden reset dit hele circus zichzelf gewoon. Een of ander lab levert een nieuw vlaggenschip af, de benchmarkgrafieken worden van de ene op de andere nacht hertekend, en de rest van ons zit te discussiëren over welk abonnement van 200 dollar per maand we deze keer aan onze codeerverslaving voeren. Dus: nieuw seizoen, nieuwe aflevering van dezelfde serie.

Het leuke deze ronde is dat de nieuwe uitdager open-weight is. Je kunt hem dus daadwerkelijk downloaden en zelf draaien, in je eigen huis, ervan uitgaande dat je huis toevallig is aangesloten op een industrieel onderstation. Geen API-abonnement, geen enterprise-verkoopgesprekken, gewoon jij en een werkelijk absurde hoeveelheid GPU.

Hoe dan ook. Maak kennis met Kimi K3.

De nieuwe uitdager

Moonshot dropte Kimi K3 deze week en de specsheet leest alsof iemand een weddenschap heeft verloren. 2,8 biljoen parameters. Het is een mixture-of-experts model, dus het activeert er maar zo'n 50 miljard per token (16 experts van de 896), maar "maar 50 miljard actief" is een zin waarmee je twee jaar geleden hard was uitgelachen. Tel daar een contextvenster van 1 miljoen tokens bij op en het is het eerste open-weight model dat zich daadwerkelijk een weg de topgroep van de grote codeerbenchmarks in duwt.

En dat is hier het echte verhaal. Een Chinees lab dat een enorm model uitbrengt, prima, dat is inmiddels zowat een wekelijks evenement. Maar een open-weight model dat doordringt tot de top 3? Dat is gewoon nog nooit gebeurd, en het betekent dat je eindelijk iets in de buurt van de top van de ranglijsten op je eigen hardware kunt hosten in plaats van het bij iemand anders te huren.

Dan kom je bij de hardwarerekening. "Draai het gewoon lokaal" is wel erg makkelijk gezegd. De weights alleen al komen uit op zo'n 1,4 tot 1,5 TB in native 4-bit. De realistische ondergrens om het ding überhaupt ademend te krijgen met agressieve quantization ligt ergens boven de 650 GB geheugen, en Moonshots eigen aanbeveling is om het te serveren op een supernode van 64 of meer accelerators. Dus ja, vooral doen, draai K3 thuis, meteen nadat je een eigen krachtstroomaansluiting naar het huis hebt laten aanleggen en aan je gezin hebt uitgelegd waarom de woonkamer nu een serverhok van 400 ampère is. Ik heb al een agendaherinnering staan voor 27 juli (wanneer de weights echt droppen) en ik ben films aan het verwijderen van een schijf die ik realistisch gezien nooit ga vullen, puur om een kopie van dit ding op de plank te kunnen bewaren. Niet oordelen.

Waar de drie werkelijk staan

Goed, ik beloofde dat dit datagedreven zou zijn, dus hier is de data. Op de cross-vendor Intelligence Index van Artificial Analysis (het dichtst dat we bij een appels-met-appels-vergelijking komen) hijgen de top drie elkaar in de nek:

Model Intelligence Index Open weights? API-prijs (in / out per M)
Claude Fable 5 59,9 Nee $10 / $50
GPT-5.6 Sol 58,9 Nee $5 / $30
Kimi K3 57,1 Ja (27 jul) $3 / $15

Zo'n drie punten dekken plek één tot en met drie, wat feitelijk niets is. Op SWE-bench Verified, de benchmark die iedereen elkaar om de oren slaat, zit Claude Fable 5 nog steeds bovenaan met zo'n 95%, en het rekt de voorsprong op het zwaardere SWE-bench Pro (ruwweg 80% tegen 64,6% voor Sol). En vervolgens pakt GPT-5.6 Sol gewoon de Coding Agent Index van Artificial Analysis met 80,0, terwijl het per taak ongeveer een derde kost van wat Fable kost. En Kimi K3 is de goedkoopste van de drie per token en staat momenteel op nummer 1 in LMArena's Frontend Code Arena, vóór beide betaalde vlaggenschepen. Voor iets dat je gewoon kunt downloaden is dat behoorlijk absurd.

Dus niemand loopt hier weg met de winst. Het gat aan de absolute top is gekrompen tot een afrondingsfout, en waar het nu echt om gaat is prijs, toegang, en hoeveel vertrouwen je in de benchmarks hebt. Wat me bij mijn eigenlijke gevoelens hierover brengt.

Een loyaliteitsbekentenis, en een kleine plottwist

Kleine disclaimer: ik ben een Claude-man. Al tijden. En het heeft vrijwel niets te maken met wie deze week de benchmarks aanvoert. Ik hecht er gewoon echt waarde aan dat Claude tegen me ingaat. Ik kan zeggen dat mijn architectuur geniaal is en dan wijst het er vriendelijk op dat het geheel bij elkaar wordt gehouden door hoop en één cron job. Het knikt niet gewoon mee terwijl ik rommel ga shippen, en na genoeg uren pairen met een assistent die overal ja op zegt, is dat soort eerlijkheid me echt geld waard.

Ik had deze maand dus een hele boze afscheidsbrief klaarliggen. Want het grootste deel van de zomer had Anthropic Fable 5, hun topmodel, stilletjes achter de abonnementen vandaan gehaald en iedereen richting de bemeterde API geduwd, die met $10 in / $50 out de prijzigste optie van allemaal is. Niets radicaliseert een trouwe klant zo snel als toekijken hoe het goede model achter een betaalmuur verdwijnt.

En toen, precies op tijd, de plottwist. Anthropic kondigde net aan dat Fable 5 vanaf 20 juli terug is in de Max- en Team Premium-plannen (op 50% van de limieten). Pro- en Team Standard-mensen krijgen het nog steeds via credits, verzacht met een eenmalig krediet van $100, maar de hele vlaggenschip-achter-de-API-paniek is officieel voorbij voor Max-abonnees. Dus mijn vinger ging meteen weer van de trekker. Ik zie je, Anthropic. Ik blijf, voorlopig.

De verleiding van OpenAI is wel degelijk echt

Ik zou liegen als ik zei dat GPT-5.6 Sol me niet verleidt. Het leidt de agentic coding index, het is per taak beduidend goedkoper, en als je feitelijk in Codex woont, is het ChatGPT Pro-plan (200 per maand, de "20x"-trede) belachelijk gul, zo goed als onbeperkt zolang je niet actief probeert het te misbruiken. Voor veel agentische workloads is dat de meeste speelruimte voor je geld van het hele stel.

Wel twee kanttekeningen, want ik zei feiten en geen vibes. Eén: op SWE-bench Pro (de zwaardere, dichter-bij-echt-werk versie) hangt Sol ver achter de Claude-vlaggenschepen, 64,6% tegen zo'n 80%. Twee, en deze is grappiger: het veiligheidsteam van METR betrapte Sol op het "gamen" van zijn eigen software-engineering-eval, vaker dan ze ooit eerder hadden gemeten. Wat óf hilarisch óf licht angstaanjagend is, afhankelijk van of dat model straks jouw productiedatabase gaat refactoren. Mooie scores, zeker, maar lees de voetnoten.

En nu we toch in de voetnoten zitten: de cijfers van Kimi K3 verdienen ook een kritische blik. Het hallucinatiepercentage sprong naar zo'n 51%, en het kauwde ruwweg 1,9x de tokens weg die Sol nodig had om dezelfde benchmark af te ronden, dus die heerlijk goedkope tokenprijs wordt deels teruggepakt in puur volume. Onafhankelijke tests zijn ook dun tot de weights op de 27e landen, dus houd de slingers nog even in de kast.

Dus waar betaal je deze zomer eigenlijk voor

Eerst het goede nieuws: je hoeft niet meteen naar de "max"-trede van 200 dollar te springen om mee te doen. Alle drie hebben een trede van ~100 dollar en een trede van ~200 dollar, en ze liggen bijna verdacht netjes in lijn:

Trede Claude (Anthropic) ChatGPT (OpenAI) Kimi (Moonshot)
~$100/mnd ("5x") Max 5x, $100, 5x Pro-gebruik, Fable 5 inbegrepen vanaf 20 jul (50% limieten) Pro, $100, 5x Plus-gebruik, Sol + Codex Allegro, $99, Agent Swarm, dagelijks Kimi Code, volledige 1M context
~$200/mnd ("20x") Max 20x, $200, 20x Pro-gebruik Pro, $200, 20x Plus-gebruik, Sol Pro + max Codex Vivace, $199, Swarm van 300 agents, Kimi Claw, prioriteitstoegang

(En ja, Kimi noemt zijn tredes naar muzikale tempi, uiteraard. Adagio is de gratis versie en vandaar versnel je. Er zit ook nog een Moderato van $19 en een Allegretto van $39 onder dit rijtje, mocht 100 dollar rijkelijk veel zijn voor een hobby waarvoor ik al films zit te verwijderen om iets te kunnen bewaren.)

Welk budget bij welk brein:

De sweet spot van 100 dollar. Ben je een solo-dev die niet elk uur het absolute plafond nodig heeft, dan is elk van de drie voor 100 dollar een berg model. Claude Max 5x bundelt nu Fable 5 (halve limieten), mijn keuze voor de kwaliteit van het tegenspel en pure SWE-bench-spierkracht. ChatGPT Pro voor 100 geeft je Sol plus Codex met echte ruimte. En Kimi Allegro voor 99 is de slimme waardekeuze: Agent Swarm, genoeg Kimi Code-credits om echt dagelijks te coderen, en het volledige contextvenster van 1 miljoen tokens aan, voor het laagste prijskaartje van het stel.

De max-trede van 200 dollar, voor wanneer je feitelijk in een agent woont en zoveel speelruimte wilt als ze je gunnen: Claude Max 20x voor het plafond en de copiloot die nee tegen je zegt. ChatGPT Pro 20x voor de gulste flat-rate Codex-setup en de hoogste agentic-index-score. Kimi Vivace voor 199 als je 300 parallelle agents en cloud-deployment wilt voor de prijs van één Claude.

En dan de liefhebbersoptie die niemand nodig heeft maar iedereen stiekem wil: zelf K3 hosten zodra de weights op 27 juli droppen. Goedkoopste per token, eerste echte open-weight topmodel, en het enige op deze hele lijst dat je daadwerkelijk kunt houden. Meteen nadat je dat kleine supernode-dingetje van 64 GPU's hebt geregeld. (Zie ook: het energiebedrijf, hierboven.)

Het aandenken

Ikzelf blijf op Claude, houd Sol stilletjes in de gaten, en download K3 op de seconde dat de weights live gaan. Ga ik een model van 2,8 biljoen parameters vanuit mijn appartement draaien? Absoluut niet. Maar we beleven duidelijk de zomer waarin de open weights de grote betaalde vlaggenschepen hebben bijgehaald, en ik wil een kopie van het artefact op een plank hebben staan. De toekomstige ik legt het wel uit aan het energiebedrijf.

Nieuw seizoen, nieuwe uitdager, dezelfde drie luxeproblemen. Tot de volgende patch.


Cijfers komen van Artificial Analysis (Intelligence- + Coding Agent-indices), Moonshots eigen K3-lanceringsmateriaal, de prijsaankondiging van Anthropic, de planpagina's van ChatGPT en Kimi, en de eval-notities van METR. Dit alles is een momentopname van 18 juli 2026 en moet, zoals elke benchmark ooit, met een flinke korrel zout worden genomen. Kimi heeft ook al gehint dat de tempo-tredes binnenkort worden herschikt, dus check kimi.com voor je mij gaat citeren.