TL;DR : les cinq infos du jour disent la même chose, l’IA locale ne se juge plus au nom du modèle mais à la façon dont on le sert. Le même Qwen ouvre un binaire commercial ou dit des bêtises, et l’écart tient dans les réglages.
1. DeepSeek V4 Flash tourne chez soi, mais pas avec le llama.cpp que vous avez
Le modèle à 284 milliards de paramètres a un portage communautaire vers llama.cpp, et ses quantifications GGUF sont publiées de 57 Gio à 282 Gio. Le détail à connaître avant un téléchargement de cette taille : ces fichiers exigent un fork spécifique, le llama.cpp officiel ne les lit pas. Comptez 16 tokens par seconde sur un Mac Studio M3 Ultra, et lisez ce qui manque : rien pour ROCm ni Vulkan, un multi-GPU CUDA en chantier.
2. Le décodage spéculatif entre dans llama.cpp
DFlash fait deviner les prochains tokens par un petit modèle, que le gros vérifie d’un seul coup. Son intégration à llama.cpp annonce 2,69x sur Qwen3.6-27B et jusqu’à 8,08x sur un modèle de 8 milliards, avec une revendication qui vaut plus que les chiffres : l’équivalence numérique avec l’implémentation d’origine, donc de la vitesse sans changer les réponses. Les modèles à experts en profitent nettement moins, l’auteur le dit lui-même.
3. Qwen 27B a reconstitué une licence logicielle en trente minutes
Un testeur a confié à un Qwen 3.8 27B local l’analyse d’un logiciel commercial dont il possédait la licence. Le modèle a retrouvé une clé RSA que l’éditeur avait masquée, sans jamais exécuter le programme. Nous en avons fait une brève à part.
4. Les 262 000 tokens de contexte, et leur astérisque
La recette officielle vLLM le pose noir sur blanc : 262 000 tokens de contexte natif, extensibles à un million, et 24,6 Gio en NVFP4, donc une seule carte Blackwell. L’astérisque est dans le même document : sur une seule RTX 5090, il faut --enforce-eager et redescendre à 32 000 tokens. Entre ce que le modèle sait faire et ce que votre machine lui laisse faire, il y a parfois une ligne de commande.
5. Et si votre modèle local vous décevait pour de mauvaises raisons
Le meilleur texte du jour est un banc d’essai posté sur Level1Techs : à modèle identique, changer le backend d’attention ou quantifier le cache KV en INT4 ne fait pas que gagner de la mémoire, ça change les jetons produits. L’auteur mesure jusqu’à 5,8 pour cent de divergences en NVFP4, assez pour casser un appel d’outil sans qu’aucune erreur ne s’affiche.
Bon dimanche, et vérifiez vos réglages avant d’accuser votre modèle.