IA en local, ce qu’il faut vraiment comme machine
David TouzetMise à jour le 12 août 202613 min de lectureFaire tourner une intelligence artificielle sur sa propre machine est devenu réellement possible, et pour une raison précise, les petits modèles ont rattrapé une bonne part de l’écart. Reste la question que personne ne pose clairement, est-ce que ça tournera chez vous. Voici le calcul qui y répond, ce que la compression fait gagner et perdre, et le mur que 2026 a dressé devant tout le monde.
- Pourquoi la question se pose seulement maintenant
- Le seul calcul qui compte
- La compression, ce qu’elle fait vraiment
- Les modèles qui n’allument qu’une partie d’eux-mêmes
- Le seuil en dessous duquel on abandonne
- Le mur de 2026, et personne n’en parle
- Ce que ça donne en budget réel
- Le seul cas où c’est irremplaçable
- Ce qu’il ne faut pas en attendre
- Par où commencer, sans rien dépenser
Pourquoi la question se pose seulement maintenant
Faire tourner un modèle chez soi n’est pas neuf. Ce qui a changé tient en 2 choses.
Les petits modèles sont devenus bons. Un modèle de 12 milliards de paramètres fait aujourd’hui ce qu’un modèle 5 fois plus gros faisait il y a 18 mois. Raisonner, lire une image, appeler un outil, écrire du code correct.
Et l’installation est devenue triviale. Il fallait être développeur, il faut désormais télécharger un logiciel et cliquer. En ligne de commande, cela tient en une ligne.
# Telecharge le modele, puis ouvre la conversation. C'est tout.
ollama run gemma4
Reste la vraie question, celle qui décide de tout, est-ce que votre machine tiendra le choc.
Le seul calcul qui compte
Oubliez les processeurs, les cœurs et les images par seconde. Une seule chose décide, la mémoire de la carte graphique.
La raison est mécanique. Pour produire chaque mot, le modèle doit relire l’intégralité de ses réglages internes. Si ceux-ci tiennent dans la mémoire de la carte graphique, tout va vite. S’ils débordent vers la mémoire ordinaire, tout s’effondre.
Le calcul du poids est une simple multiplication.
Mémoire nécessaire ≈ nombre de milliards de paramètres × octets par paramètre
Pleine précision (16 bits) → 2 octets → un modèle 12B pèse 24 Go
Compressé en 8 bits → 1 octet → un modèle 12B pèse 12 Go
Compressé en 4 bits → 0,5 octet → un modèle 12B pèse 6 Go
⚠ Ajoutez toujours 20 à 30% pour la conversation en cours,
qui occupe elle aussi de la mémoire et grossit à mesure qu'elle avance.
Le raccourci à retenir. En 4 bits, comptez la moitié du nombre de milliards, en gigaoctets. Un modèle de 12 milliards tient dans 8 Go de carte graphique, un modèle de 27 milliards en demande 16, un modèle de 70 milliards en demande 40 et sort du domaine du grand public.
La compression, ce qu’elle fait vraiment
Le mot technique est quantisation, et il fait peur pour rien.
Le principe. Chaque réglage interne du modèle est un nombre à virgule. On l’arrondit. Un poids de 0,823491 devient 0,82, puis 0,8. Le fichier fond, la vitesse monte.
Ce qui n’est pas touché, et c’est important. Aucune connexion n’est supprimée, aucune connaissance n’est effacée. Le modèle garde exactement la même structure, il devient simplement moins précis dans ses nuances. La comparaison juste est celle d’une photo compressée, c’est la même image avec moins de finesse.
Où la perte se voit, et où elle ne se voit pas. Sur un résumé, une reformulation, une discussion, vous ne verrez aucune différence entre la pleine précision et 4 bits. Sur du raisonnement long, du calcul, du code précis ou une chaîne d’étapes à enchaîner, elle devient perceptible.
Le réglage raisonnable. 4 bits pour l’usage courant, 8 bits si la machine le permet et que la tâche demande de la rigueur. En dessous de 4 bits, la dégradation devient franche et le jeu n’en vaut plus la chandelle.
Les modèles qui n’allument qu’une partie d’eux-mêmes
Une architecture change la donne et mérite d’être connue, parce qu’elle rend accessibles des modèles qui semblaient hors de portée.
Un modèle classique mobilise l’ensemble de ses paramètres à chaque mot produit. Certains modèles récents n’en activent qu’une fraction, celle qui correspond à la question posée.
L’écart est spectaculaire. Un modèle annoncé à 284 milliards de paramètres peut n’en activer que 13 pendant qu’il répond. Vous obtenez l’étendue de connaissances du grand modèle avec la vitesse d’un petit.
⚠ Attention au malentendu. Il faut quand même charger l’ensemble en mémoire. Ces modèles ne demandent pas moins de mémoire, ils demandent moins de calcul. Ils rendent l’usage plus rapide, pas plus accessible.
Le seuil en dessous duquel on abandonne
La vitesse se mesure en mots produits par seconde, et l’expérience donne des repères nets.
- Sous 10 mots par seconde, personne ne tient. On regarde le texte s’écrire lettre par lettre et on retourne à l’outil en ligne.
- Entre 10 et 30, c’est utilisable pour du texte, du résumé, de la rédaction.
- Au-delà de 30, c’est confortable, y compris pour travailler à plusieurs.
Le second chiffre, celui qu’on oublie. La vitesse à laquelle le modèle avale ce que vous lui donnez, avant même de commencer à répondre. Sur un document de 50 pages, cette phase peut durer 15 secondes avant le premier mot. C’est ce qui rend une machine trop juste franchement pénible à l’usage, bien plus que la vitesse d’écriture.
Et le piège qui surprend tout le monde. Plus la conversation avance, plus elle occupe de mémoire. Une machine qui tenait au début se met à ramer au bout de 20 échanges, parce que l’historique déborde de la carte graphique.
Le mur de 2026, et personne n’en parle
Voici le fait qui change tout le calcul économique, et il est récent.
Le prix de la mémoire a plus que quadruplé. Un ensemble de 32 Go qui coûtait environ 90 € en septembre 2025 s’échange autour de 400 € début 2026. La hausse moyenne sur la période dépasse 340%.
La cause est directe. Les centres de données qui font tourner les grands modèles ont absorbé une part considérable de la production mondiale des 3 fabricants de mémoire. La demande industrielle a évincé la demande grand public.
Et ce n’est pas un accident passager. Les analystes du secteur décrivent une pénurie structurelle, avec un retour à la normale espéré vers fin 2027.
L’ironie mérite d’être soulignée. L’IA locale devient techniquement accessible au moment précis où elle devient financièrement plus lourde, et pour la raison même de son succès. Un dirigeant qui a lu un article de 2025 sur le sujet raisonne aujourd’hui sur des prix qui n’existent plus.
Ce que ça donne en budget réel
Restons concrets, avec les ordres de grandeur d’août 2026 et sans faire de publicité pour personne.
Pour découvrir sans rien acheter. Une carte graphique de milieu de gamme déjà présente dans un ordinateur de jeu, avec 12 Go, fait tourner un modèle de 12 milliards de paramètres en 4 bits. C’est le point d’entrée, et il est gratuit si le matériel est là.
Pour un usage sérieux par une personne. Il faut viser 24 à 32 Go de mémoire graphique. Une carte d’occasion de génération précédente reste le meilleur rapport, autour de 750 à 1000 €. Un ordinateur à mémoire unifiée fait aussi bien pour le texte, avec un silence appréciable, mais coûte plus cher.
Pour plusieurs personnes en même temps, on change de catégorie. Les cartes professionnelles à 96 Go dépassent 13000 € l’unité, et il faut y ajouter une machine capable de les recevoir. On parle de dizaines de milliers d’euros.
Le calcul honnête. Un abonnement à 20 € par mois représente 240 € par an. Une machine à 3000 € met plus de 12 ans à se rembourser sur ce seul critère, et le matériel n’aura pas cette durée de vie. L’IA locale ne se justifie donc presque jamais par l’économie. Elle se justifie par ce qu’elle permet et que l’abonnement interdit.
Le seul cas où c’est irremplaçable
Voilà l’argument qui tient debout, et il n’a rien de financier.
Certains fichiers ne peuvent pas sortir. Un rapport confidentiel, un fichier client, un dossier juridique, des données de santé, un contrat en cours de négociation. Les envoyer à un service en ligne n’est pas une question de préférence, c’est souvent une faute.
Avec un modèle local et la connexion coupée, la question ne se pose plus. Vous pouvez lui faire résumer un document de 200 pages, en extraire des chiffres, le reformuler, sans qu’une seule ligne quitte la machine.
C’est aussi la réponse au problème le plus répandu en entreprise, celui des salariés qui utilisent leur compte personnel pour traiter des documents professionnels. Interdire ne marche pas, ils continuent en cachette. Fournir un outil qui ne fait rien sortir marche, cf Shadow AI, l’IA que vos salariés utilisent sans vous le dire.
Les autres bénéfices existent mais sont secondaires. Pas de quota qui saute au mauvais moment, pas de panne de fournisseur, pas de modèle qui disparaît du jour au lendemain, et le fonctionnement sans réseau.
Ce qu’il ne faut pas en attendre
3 mises au point, parce que les démonstrations enthousiastes les passent sous silence.
Ce ne sera pas aussi bon. Sur du raisonnement complexe, du code exigeant ou une longue chaîne d’étapes, l’écart avec les meilleurs modèles en ligne reste net. Le vendre comme équivalent revient à décevoir le premier jour.
Ce n’est pas de l’informatique sans entretien. Une machine qui sert de serveur doit rester allumée, être mise à jour, être refroidie. Elle chauffe, elle fait du bruit, et sur un portable elle vide la batterie en quelques dizaines de minutes.
Les modèles ne connaissent pas l’actualité. Leur savoir s’arrête à une date. Sans connexion, ils inventent avec aplomb plutôt que d’avouer leur ignorance. Nous l’avons vérifié nous-mêmes, un modèle local interrogé sur un produit récent a décrit avec assurance un modèle qui n’existe pas. Pour tout ce qui doit être à jour, le local seul ne convient pas.
Par où commencer, sans rien dépenser
3 étapes, dans cet ordre, et les 2 premières sont gratuites.
1. Regardez ce que votre machine peut porter. La mémoire de votre carte graphique se lit en 2 clics dans le gestionnaire de tâches. Appliquez la règle, la moitié du nombre de milliards en gigaoctets, et vous saurez quel modèle viser.
2. Installez et essayez, ça prend 10 minutes. Un logiciel à télécharger, un modèle à choisir dans une liste, et vous discutez. Les outils courants n’affichent que les modèles compatibles avec votre matériel, ce qui évite de télécharger 20 Go pour rien.
3. Jugez sur votre vrai travail, pas sur une question piège. Donnez-lui un document que vous connaissez, demandez-lui un résumé, comparez au vôtre. C’est le seul test qui vous dira si l’outil vous sert.
Et gardez la bonne question en tête. Elle n’est pas de savoir si le modèle local égale celui en ligne, il ne l’égale pas. Elle est de savoir ce que vous ne pouvez pas envoyer ailleurs. S’il n’y a rien, l’abonnement suffit. S’il y a quelque chose, aucun abonnement ne le remplacera.
À lire ensuite
Pour aller plus loin sur le sujet.
Questions fréquentes
Un site sur mesure, piloté par des experts.
À Montpellier, on conçoit, développe et pilote votre présence web. Vous restez concentré sur vos clients, on gère la technique et le contenu.
Faire le point sur votre siteUne équipe IA qui accélère votre visibilité.
SEO, rédaction, réseaux sociaux, publicité et veille. 12 agents IA métier travaillent en continu pour générer du trafic et des leads.
Voir les 12 agents