17 août 2026 · 5 min de lecture

Qwen3.8-27B tourne maintenant sur ma propre machine, et il est vraiment bon

Il y a deux semaines, je vous disais de vérifier qwen.ai avant de me citer, parce qu'Alibaba avait promis les poids de Qwen3.8 « pour la semaine prochaine », et je m'attendais à moitié à voir la date glisser discrètement. Eh bien non. J'ai vérifié, les poids sont en ligne. Le mastodonte de 2,4 billions de paramètres, Qwen3.8-Max, est arrivé le 13 août, et celui qui m'intéresse vraiment, Qwen3.8-27B, a suivi le lendemain.

Un truc que je n'avais pas vu venir, par contre. Le géant est sorti sous une licence maison restrictive, avec des clauses de revenus. Le petit est sorti sous Apache 2.0, la licence propre, celle qui vous laisse faire ce que vous voulez. Pour une fois, le modèle que les gens normaux peuvent faire tourner est aussi le plus ouvert des deux.

Ce que c'est

Un modèle de 27 milliards de paramètres qui comprend le texte, l'image et la vidéo, retient un roman et demi de contexte (262 000 tokens) et se compresse en un fichier d'environ 17 Go, et c'est surtout ça qui m'intéresse. Ça tient sur un seul GPU de gaming ou un Mac avec 24 Go de mémoire. Unsloth l'avait quantizé en quelques heures, exactement comme la dernière fois. Il a fini numéro 1 sur Hacker News le jour même, et il a été téléchargé plus de cent mille fois dans les premiers jours.

Est-il bon, au moins ?

Sur les benchmarks d'Alibaba, oui, étonnamment bon même. Il devance Claude Opus 4.6 sur une poignée de tests de code et d'usage d'ordinateur, et s'incline sur le raisonnement pur :

Benchmark (chiffres du vendeur) Qwen3.8-27B Claude Opus 4.6 Max
SWE-bench Pro 61,7 53,4
OSWorld-Verified 84,3 72,7
LiveCodeBench v6 90,3 88,8
GPQA Diamond 89,2 91,3
Terminal-Bench 2.1 73,0 78,2

Soyons honnêtes : ce sont les chiffres d'Alibaba, mesurés sur leur propre harnais. Personne d'indépendant ne l'a encore noté. Ni Artificial Analysis ni LMArena n'ont publié le moindre chiffre pour le 27B. Donc le « il bat Opus » est à prendre avec de grosses pincettes, comme d'habitude.

Mais la personne dont l'avis compte pour moi ici, c'est Simon Willison, qui l'a fait tourner sur ses propres machines et l'a jugé « excellent ». Une de ses phrases m'est restée en tête : « Il y a un an, ce modèle aurait rivalisé avec les meilleurs et les plus chers des modèles propriétaires. Aujourd'hui, il tourne sur un bon laptop. » Pour moi, tout est là.

Un très bon marteau dans votre propre tiroir

Voyez ça comme les outils d'un garage. Un flagship cloud comme Claude Fable 5 ou GPT-5.6 Sol, c'est une masse : énorme, chère, imbattable le jour où il faut vraiment abattre un mur. Mais la plupart du travail, ce n'est pas un mur. La plupart du travail, ce sont des clous. Résume ceci, refactore cela, rédige ce mail, étiquette ces images, écris ce script. On ne prend pas une masse pour planter un clou. Qwen3.8-27B est un très bon marteau qui vit dans votre propre tiroir, ne coûte rien au coup et ne laisse pas sortir un octet de votre machine. Et le rare jour où vous tombez sur un mur, vous envoyez cette tâche-là à la masse dans le cloud. C'est une raison de moins de dépendre des grands fournisseurs cloud.

Ce que ça change concrètement

Si vous n'êtes pas technique : une vraie IA qui tourne hors ligne, sur du matériel que vous possédez déjà, gratuitement, avec vos données qui restent sur votre bureau. De la science-fiction il y a douze mois.

Si vous gérez une équipe : pas besoin de payer des prix de flagship pour toute la charge de travail. Le schéma vers lequel les équipes convergent, c'est le partage. Le 27B local absorbe le gros volume de travail routinier à coût fixe, et seuls les 10 % les plus durs partent vers une API premium. Moins de dépendance au fournisseur, plus de levier. Et c'est exactement cette pression qui garde les prix de tout le monde raisonnables : OpenAI a discrètement baissé un de ses modèles GPT-5.6 de 80 %, trois semaines après son lancement. Personne ne fait ça par bonté d'âme.

Si vous codez : il pilote des agents de code, appelle des outils, produit de petits utilitaires du premier coup et fait de la vision (il est vraiment doué pour tracer des bounding boxes). Deux bémols. Il n'est pas rapide : comptez 15 à 30 tokens par seconde sur du bon matériel grand public, moins de dix sur un Mac d'entrée de gamme, contre 74 et plus pour un flagship hébergé. Et il est livré avec le raisonnement réglé sur « xhigh » par défaut, ce qui le fait suranalyser jusqu'à l'absurde. Willison l'a regardé passer 21 minutes et 22 000 tokens de raisonnement sur un seul SVG représentant un cercle. Baissez le raisonnement sur « low », et activez la multi-token prediction pour gagner environ 70 % de vitesse.

Les réserves honnêtes

Parce qu'il y en a toujours. Les chiffres indépendants ne sont pas là : tous les bons scores viennent soit du tableau d'Alibaba, soit du laptop d'un seul testeur. C'est lent. Les réglages par défaut sont absurdes. Et un modèle dense de 27B est un gouffre à bande passante mémoire, donc le contexte long devient vite étroit (32K de contexte mangent déjà quelques gigas de cache KV), donc en pratique il vous faut une carte à 24 Go, pas à 16.

Mais la tendance n'a rien de discret. Un modèle qui aurait été à la frontière il y a un an tient désormais dans un fichier de 17 Go posé sur votre bureau, gratuitement.

Moins cher, plus ouvert, plus difficile à ignorer. J'avais dit que je prenais. Je prends.


Chiffres tirés de la fiche modèle Qwen, de Hugging Face, de la documentation d'Unsloth, du compte rendu de Simon Willison, d'Artificial Analysis et de la couverture habituelle du lancement. Un instantané au 17 août 2026, servi, comme toujours, avec de grosses pincettes : tous les scores de benchmark ci-dessus sont ceux d'Alibaba, en attendant le verdict des classements indépendants.