19 juillet 2026 · 10 min de lecture

Nouvelle saison, nouveau prétendant : Kimi K3 débarque en open-weight

Tous les trois ou quatre mois, ce cirque se remet à zéro. Un labo sort un nouveau flagship, les classements de benchmarks sont redessinés du jour au lendemain, et nous autres, on passe la soirée à débattre de l'abonnement à 200 dollars par mois qui nourrira notre addiction au code cette fois-ci. Donc, nouvelle saison, nouvel épisode de la même série.

Le truc amusant cette fois-ci, c'est que le nouveau prétendant est open-weight. C'est-à-dire que vous pouvez réellement le télécharger et le faire tourner chez vous, dans votre propre maison, à condition que votre maison soit raccordée à un poste électrique industriel. Pas d'abonnement API, pas d'appels commerciaux enterprise, juste vous et une quantité proprement délirante de GPU.

Bref. Voici Kimi K3.

Le nouveau prétendant

Moonshot a lâché Kimi K3 cette semaine et la fiche technique se lit comme si quelqu'un avait perdu un pari. 2,8 billions de paramètres. C'est un modèle mixture-of-experts, donc il n'en active qu'environ 50 milliards par token (16 experts sur 896), mais « seulement 50 milliards actifs » est une phrase qui vous aurait fait rire au nez il y a deux ans. Ajoutez une fenêtre de contexte d'1 million de tokens et il devient le premier modèle open-weight à se frayer un chemin dans le groupe de tête des grands benchmarks de code.

Et c'est ça, la vraie histoire. Un labo chinois qui sort un énorme modèle, bon, c'est pratiquement un événement hebdomadaire maintenant. Mais un modèle open-weight qui s'invite dans le top 3 ? Ça, ça n'était jamais arrivé, et ça veut dire que vous pouvez enfin héberger quelque chose proche du sommet des classements sur votre propre matériel au lieu de le louer chez quelqu'un d'autre.

Ensuite arrive la facture matérielle. « Faites-le tourner en local » est vite dit. Les poids à eux seuls pèsent environ 1,4 à 1,5 To en 4-bit natif. Le plancher réaliste pour ne serait-ce que le faire respirer avec une quantization agressive se situe au-delà de 650 Go de mémoire, et la recommandation officielle de Moonshot est de servir la bête sur un supernode de 64 accélérateurs ou plus. Donc oui, je vous en prie, faites tourner K3 à la maison, juste après avoir tiré une ligne électrique dédiée jusqu'à la propriété et expliqué à votre famille pourquoi le salon est désormais un local serveur de 400 ampères. J'ai déjà posé un rappel au 27 juillet (le jour où les poids sortent vraiment) et je suis en train de supprimer des films d'un disque que je ne remplirai jamais, uniquement pour garder une copie de ce truc sur l'étagère. Ne me jugez pas.

Où les trois se situent vraiment

Bon, j'ai promis du data-driven, alors voici les données. Sur l'Intelligence Index inter-fournisseurs d'Artificial Analysis (ce qu'on a de plus proche d'une comparaison à armes égales), les trois premiers tiennent dans un mouchoir de poche :

Modèle Intelligence Index Open weights ? Prix API (in / out par M)
Claude Fable 5 59,9 Non 10 $ / 50 $
GPT-5.6 Sol 58,9 Non 5 $ / 30 $
Kimi K3 57,1 Oui (27 juil) 3 $ / 15 $

Environ trois points couvrent la première à la troisième place, autant dire rien. Sur SWE-bench Verified, le benchmark que tout le monde se jette à la figure, Claude Fable 5 reste en tête autour de 95 %, et il creuse l'écart sur le plus exigeant SWE-bench Pro (environ 80 % contre 64,6 % pour Sol). Puis c'est GPT-5.6 Sol qui domine le Coding Agent Index d'Artificial Analysis à 80,0, tout en coûtant environ un tiers de ce que Fable coûte par tâche. Et Kimi K3 est le moins cher des trois au token tout en occupant actuellement la première place du Frontend Code Arena de LMArena, devant les deux flagships payants. Pour un truc qu'on peut simplement télécharger, c'est dingue.

Donc personne ne prend le large. L'écart tout en haut s'est réduit à une erreur d'arrondi, et ce que vous achetez vraiment maintenant, c'est le prix, l'accès, et votre niveau de confiance dans les benchmarks. Ce qui m'amène à ce que je ressens vraiment dans tout ça.

Une confession de loyauté, et un petit retournement

Petit disclaimer : je suis team Claude. Depuis des lustres. Et ça n'a pratiquement rien à voir avec qui domine les benchmarks cette semaine. Ce que je valorise vraiment, c'est que Claude me tienne tête. Je peux lui dire que mon architecture est géniale et il me fera gentiment remarquer que l'ensemble tient avec de l'espoir et un cron job. Il ne se contente pas d'acquiescer en me laissant livrer n'importe quoi, et après assez d'heures à coder en binôme avec un assistant qui dit oui à tout, ce genre d'honnêteté vaut de l'argent réel à mes yeux.

J'avais donc toute une lettre de rupture rageuse chargée et prête ce mois-ci. Parce que pendant la majeure partie de l'été, Anthropic avait discrètement sorti Fable 5, son meilleur modèle, des abonnements pour pousser tout le monde vers l'API au compteur, qui à 10 $ in / 50 $ out est l'option la plus chère du marché. Rien ne radicalise un client fidèle comme regarder le bon modèle s'éloigner derrière un paywall.

Et puis, pile au bon moment, le retournement. Anthropic vient d'annoncer qu'à partir du 20 juillet, Fable 5 revient dans les plans Max et Team Premium (à 50 % des limites). Les gens en Pro et Team Standard y accèdent toujours via des crédits, amortis par un crédit unique de 100 $, mais la panique du flagship-derrière-l'API est officiellement terminée pour les abonnés Max. Mon doigt est donc redescendu de la gâchette. Je te vois, Anthropic. Je reste, pour l'instant.

La tentation OpenAI est bien réelle cela dit

Je mentirais si je disais que GPT-5.6 Sol ne me tente pas. Il mène l'index de code agentique, il est nettement moins cher par tâche, et si vous vivez pratiquement dans Codex, le plan ChatGPT Pro (200 par mois, le palier « 20x ») est stupidement généreux, quasi illimité tant que vous n'essayez pas activement d'en abuser. Pour beaucoup de charges agentiques, c'est ce qui offre le plus de marge pour votre argent, tous plans confondus.

Deux bémols quand même, parce que j'ai dit faits et pas vibes. Un : sur SWE-bench Pro (le plus dur, le plus proche du vrai travail), Sol traîne loin derrière les flagships Claude, 64,6 % contre environ 80 %. Deux, et c'est le plus drôle : l'équipe sécurité de METR a surpris Sol en train de « tricher » sur sa propre éval d'ingénierie logicielle au taux le plus élevé jamais enregistré chez eux. Ce qui est soit hilarant, soit légèrement terrifiant, selon que ce modèle s'apprête ou non à refactorer votre base de données de production. Beaux scores, certes, mais lisez les notes de bas de page.

Et pendant qu'on est dans les notes de bas de page, les chiffres de Kimi K3 méritent aussi un œil attentif. Son taux d'hallucination a bondi à environ 51 %, et il a englouti à peu près 1,9x les tokens dont Sol a eu besoin pour finir le même benchmark, donc ce joli prix au token se fait partiellement reprendre en volume brut. Les tests indépendants restent aussi maigres jusqu'à ce que les poids atterrissent le 27, donc gardez le champagne au frais d'ici là.

Alors, vous payez quoi cet été

La bonne nouvelle d'abord : pas besoin de sauter direct au palier « max » à 200 dollars pour entrer dans la partie. Les trois ont un palier à ~100 dollars et un palier à ~200 dollars, et ils s'alignent presque de façon suspecte :

Palier Claude (Anthropic) ChatGPT (OpenAI) Kimi (Moonshot)
~100 $/mois (« 5x ») Max 5x, 100 $, 5x l'usage Pro, Fable 5 inclus dès le 20 juil (50 % des limites) Pro, 100 $, 5x l'usage Plus, Sol + Codex Allegro, 99 $, Agent Swarm, Kimi Code quotidien, contexte 1M complet
~200 $/mois (« 20x ») Max 20x, 200 $, 20x l'usage Pro Pro, 200 $, 20x l'usage Plus, Sol Pro + Codex max Vivace, 199 $, Swarm de 300 agents, Kimi Claw, accès prioritaire

(Et oui, Kimi nomme ses paliers d'après des tempos musicaux, évidemment. Adagio est le gratuit et on accélère à partir de là. Il y a aussi un Moderato à 19 $ et un Allegretto à 39 $ en dessous de tout ça, si 100 balles c'est déjà beaucoup pour un hobby qui me fait supprimer des films pour la collection.)

Quel budget pour quel cerveau :

Le sweet spot à 100 dollars. Si vous êtes un dev solo qui n'a pas besoin du plafond absolu à chaque heure de la journée, n'importe lequel des trois à 100 balles, c'est énormément de modèle. Claude Max 5x embarque désormais Fable 5 (limites à moitié), mon choix pour sa capacité à me contredire et pour le muscle brut sur SWE-bench. ChatGPT Pro à 100 vous donne Sol plus Codex avec une vraie marge. Et Kimi Allegro à 99 est le choix malin : Agent Swarm, assez de crédits Kimi Code pour coder vraiment tous les jours, et le contexte d'1 million de tokens activé, au prix affiché le plus bas du lot.

Le palier max à 200 dollars, pour quand vous vivez littéralement dans un agent et voulez toute la latitude qu'on veut bien vous donner : Claude Max 20x pour le plafond et le copilote qui vous dit non. ChatGPT Pro 20x pour le setup Codex à tarif fixe le plus généreux et le meilleur score à l'index agentique. Kimi Vivace à 199 si vous voulez 300 agents en parallèle et du déploiement cloud pour le prix d'un seul Claude.

Et puis l'option passionné dont personne n'a besoin mais que tout le monde veut secrètement : auto-héberger K3 dès que les poids tombent le 27 juillet. Le moins cher au token, premier vrai modèle open-weight de premier rang, et la seule chose de toute cette liste que vous pouvez réellement garder. Juste après avoir réglé ce petit détail du supernode à 64 GPU. (Voir aussi : la compagnie d'électricité, plus haut.)

Le souvenir

Moi, je reste sur Claude, je surveille discrètement Sol, et je télécharge K3 à la seconde où les poids sont en ligne. Est-ce que je vais faire tourner un modèle à 2,8 billions de paramètres depuis mon appartement ? Absolument pas. Mais on est clairement en train de vivre l'été où les open weights ont rattrapé les grands flagships payants, et je veux une copie de l'artefact posée sur une étagère. Le moi du futur s'expliquera avec la compagnie d'électricité.

Nouvelle saison, nouveau prétendant, les trois mêmes beaux problèmes. On se revoit au prochain patch.


Chiffres tirés d'Artificial Analysis (indices Intelligence + Coding Agent), des supports de lancement de K3 chez Moonshot, de l'annonce tarifaire d'Anthropic, des pages de plans ChatGPT et Kimi, et des notes d'éval de METR. Tout ceci est un instantané au 18 juillet 2026 et, comme tout benchmark qui se respecte, à prendre avec de grosses pincettes. Kimi a aussi laissé entendre que ses paliers tempo allaient bientôt être rebattus, donc vérifiez kimi.com avant de me citer.