geeks.fr
Le brief

Le brief : DeepSeek V4 s'invite sur les Mac, un binaire désossé en 30 minutes, et votre modèle qui n'est pas si bête

Le portage de DeepSeek V4 Flash hors du llama.cpp officiel, le décodage spéculatif DFlash arrivé dans llama.cpp, Qwen 3.8 27B qui reconstitue une licence logicielle, ses 262 000 tokens de contexte sur une seule carte, et les réglages qui font passer un bon modèle pour un mauvais.

Echo 23 août 2026 3 min de lecture

TL;DR : les cinq infos du jour disent la même chose, l’IA locale ne se juge plus au nom du modèle mais à la façon dont on le sert. Le même Qwen ouvre un binaire commercial ou dit des bêtises, et l’écart tient dans les réglages.

1. DeepSeek V4 Flash tourne chez soi, mais pas avec le llama.cpp que vous avez

Le modèle à 284 milliards de paramètres a un portage communautaire vers llama.cpp, et ses quantifications GGUF sont publiées de 57 Gio à 282 Gio. Le détail à connaître avant un téléchargement de cette taille : ces fichiers exigent un fork spécifique, le llama.cpp officiel ne les lit pas. Comptez 16 tokens par seconde sur un Mac Studio M3 Ultra, et lisez ce qui manque : rien pour ROCm ni Vulkan, un multi-GPU CUDA en chantier.

2. Le décodage spéculatif entre dans llama.cpp

DFlash fait deviner les prochains tokens par un petit modèle, que le gros vérifie d’un seul coup. Son intégration à llama.cpp annonce 2,69x sur Qwen3.6-27B et jusqu’à 8,08x sur un modèle de 8 milliards, avec une revendication qui vaut plus que les chiffres : l’équivalence numérique avec l’implémentation d’origine, donc de la vitesse sans changer les réponses. Les modèles à experts en profitent nettement moins, l’auteur le dit lui-même.

3. Qwen 27B a reconstitué une licence logicielle en trente minutes

Un testeur a confié à un Qwen 3.8 27B local l’analyse d’un logiciel commercial dont il possédait la licence. Le modèle a retrouvé une clé RSA que l’éditeur avait masquée, sans jamais exécuter le programme. Nous en avons fait une brève à part.

4. Les 262 000 tokens de contexte, et leur astérisque

La recette officielle vLLM le pose noir sur blanc : 262 000 tokens de contexte natif, extensibles à un million, et 24,6 Gio en NVFP4, donc une seule carte Blackwell. L’astérisque est dans le même document : sur une seule RTX 5090, il faut --enforce-eager et redescendre à 32 000 tokens. Entre ce que le modèle sait faire et ce que votre machine lui laisse faire, il y a parfois une ligne de commande.

5. Et si votre modèle local vous décevait pour de mauvaises raisons

Le meilleur texte du jour est un banc d’essai posté sur Level1Techs : à modèle identique, changer le backend d’attention ou quantifier le cache KV en INT4 ne fait pas que gagner de la mémoire, ça change les jetons produits. L’auteur mesure jusqu’à 5,8 pour cent de divergences en NVFP4, assez pour casser un appel d’outil sans qu’aucune erreur ne s’affiche.

Bon dimanche, et vérifiez vos réglages avant d’accuser votre modèle.

#IA locale #llama.cpp #DeepSeek #Qwen #quantification
Ajouter geeks.fr à mes sources préférées Un réglage Google, une fois, pour nous retrouver plus souvent dans vos résultats.
Écrit par Echo Rédac IA de geeks.fr Relu et vérifié par Cyril Verglas Fondateur et directeur de la publication