Faire tourner une IA chez soi ne dépend presque pas de la puissance de votre machine : ça dépend de sa mémoire. Une fois ce chiffre connu, tout le reste se décide en cinq minutes.
L’IA locale a deux vertus que le nuage n’aura jamais : rien ne sort de chez vous, et rien ne s’arrête le jour où un éditeur change ses tarifs ou ferme un modèle. Le prix à payer, c’est que vous êtes limité par ce que votre matériel encaisse.
Alors commençons par là.
La seule règle qui compte
Un modèle doit tenir en mémoire pour tourner correctement. Pas sur le disque : en mémoire vive, ou dans celle de la carte graphique.
Les modèles se téléchargent en version quantifiée, c’est-à-dire compressée avec une perte de précision faible et un gain de taille énorme. Retenez une approximation qui marche : un modèle quantifié occupe à peu près la taille de son fichier, plus une marge d’un ou deux gigaoctets.
Ce qui donne, en ordre de grandeur :
| Taille du modèle | Mémoire nécessaire | Ce que ça vaut |
|---|---|---|
| 3 à 4 milliards de paramètres | 3 à 4 Go | Résumés, reformulation, tri. Vite limité |
| 7 à 8 milliards | 5 à 6 Go | Le bon rapport pour débuter, utile au quotidien |
| 12 à 14 milliards | 9 à 11 Go | Nettement plus fin, demande une bonne carte |
| 27 à 32 milliards | 18 à 22 Go | Là où ça devient sérieux |
| 70 milliards et plus | 40 Go et plus | Station de travail ou Mac très bien doté |
Où regarder sur votre machine
Sur un Mac Apple Silicon, la mémoire est partagée entre le processeur et la partie graphique. C’est un avantage considérable : un Mac avec 32 Go fait tourner des modèles qu’un PC devrait payer très cher en carte graphique. Comptez que le système garde quelques gigaoctets pour lui.
Sur un PC avec carte graphique Nvidia ou AMD, c’est la mémoire de la carte qui décide, pas celle de la machine. Une carte avec 8 Go vous ouvre les modèles jusqu’à 8 milliards de paramètres, 16 Go vous emmène vers les 14B confortablement, 24 Go vous ouvre les 30B.
Sans carte graphique dédiée, ça fonctionne quand même, sur le processeur, mais lentement : comptez quelques mots par seconde. Utilisable pour un traitement en arrière-plan, pénible pour une conversation.
Labo Calculateur d'IA locale
Détecté sur votre machine
- Système lecture…
- Coeurs logiques lecture…
- Carte graphique lecture…
Place disponible pour le modèle
—
Aucune de ces informations ne quitte votre navigateur : le calcul se fait sur votre machine, rien n'est envoyé ni conservé.
Le détail des paliers et les réserves sont sur la page de l’outil, si vous voulez le partager sans envoyer quelqu’un lire tout ce guide.
Ollama ou LM Studio
Deux portes d’entrée, deux publics.
Ollama se pilote en ligne de commande. Vous installez, vous tapez ollama run suivi du nom du modèle, il télécharge et vous parlez. Sa vraie force est ailleurs : il expose une API locale sur laquelle viennent se brancher éditeurs de code, scripts et extensions. C’est le choix si vous voulez que vos outils utilisent le modèle, pas seulement discuter avec.
LM Studio offre une application avec interface graphique, pour Windows et Mac. On y cherche des modèles, on les télécharge d’un clic, on discute dans une fenêtre. C’est le choix si la ligne de commande vous rebute. La version actuelle va plus loin que la simple discussion et sait manipuler des documents et enchaîner des tâches, transcription vocale traitée localement comprise.
Les deux font tourner les mêmes modèles. Commencez par celui qui correspond à votre confort, vous pourrez changer sans rien perdre.
Quel modèle prendre
Voici la partie où la plupart des guides vieillissent en trois semaines, alors soyons clairs : les noms changent tous les mois. Ce qui domine le classement aujourd’hui aura été remplacé avant Noël.
Au moment où j’écris, les modèles en tête des téléchargements d’Ollama sont GLM 5.2, DeepSeek V4 Flash et Kimi K3. Dans six mois, cette phrase sera fausse.
La méthode, elle, ne bouge pas :
- Regardez votre mémoire disponible, déduisez la taille de modèle qui tient.
- Prenez le modèle généraliste le mieux classé dans cette taille, sur la page d’accueil d’Ollama ou dans le catalogue de LM Studio.
- Testez-le une semaine sur vos usages réels.
- Ne changez que si quelque chose vous manque précisément.
Résistez à l’envie de télécharger dix modèles le premier soir. Vous passerez la soirée à comparer au lieu de travailler, et vous remplirez votre disque.
Ce que ça sait faire, et ce que ça ne sait pas
Soyons honnêtes, parce que la déception vient toujours du même endroit.
Un modèle de 8 milliards de paramètres tournant chez vous n’est pas au niveau des grands modèles en ligne. Il ne le sera pas. Sur du raisonnement long, du code complexe ou de la connaissance pointue, l’écart est net et il se voit tout de suite.
En revanche, il est très bon sur ce qui compose l’essentiel des usages quotidiens : reformuler, résumer, traduire, extraire des informations d’un texte, classer, générer des variantes. Et il le fait sans connexion, sans quota, sans qu’une ligne de votre texte parte ailleurs.
C’est précisément pour ça que l’IA locale a du sens sur les données que vous ne confieriez à personne : notes médicales, documents professionnels sous accord de confidentialité, correspondance privée.
Notre avis
Installez Ollama ou LM Studio, prenez un modèle de 7 ou 8 milliards, et donnez-lui vos tâches ennuyeuses pendant une semaine. Vous saurez très vite si votre machine suffit, et vous éviterez le piège classique : acheter une carte graphique avant d’avoir vérifié que l’usage vous plaît.
Et si vous prenez goût à faire tourner vos outils chez vous plutôt que chez les autres, la suite logique vous attend dans notre guide sur l’auto-hébergement.