Choisir une IA locale : méthode, matériel et limites
Pour choisir une IA locale, vérifiez d’abord que « local » est vrai chez vous : la machine exécute le modèle, le réseau peut être coupé, les données ne sortent pas. Choisissez ensuite le type de modèle selon l’usage, mesurez la mémoire réellement disponible, et méfiez-vous des modèles qui portent un nom local tout en s’exécutant sur les serveurs d’un éditeur.
Sommaire

Le besoin type : garder un document chez soi, travailler hors connexion, éviter d’envoyer un fichier à un service distant, et savoir si une IA locale y répond, avec quel matériel et à quel prix en temps. Les recommandations matérielles citées plus bas viennent des éditeurs d’outils, pas d’une mesure faite sur votre machine ; le débit réel, lui, ne se lit que dans votre propre essai.
Que veut dire « local », exactement ?
« Local » n’est pas une propriété du logiciel que vous avez téléchargé : c’est une propriété du chemin que prennent vos données à l’instant où vous posez votre question. Trois vérifications suffisent à trancher.
Les trois questions qui définissent « local »
| Question | Réponse « local » | Réponse « pas local » |
|---|---|---|
| Où le calcul a-t-il lieu ? | sur un processeur ou une carte graphique de votre machine | sur une machine que vous ne contrôlez pas |
| Le service fonctionne-t-il sans réseau ? | oui, modèle déjà téléchargé | non, une requête sort à chaque question |
| Où vont le prompt et la réponse ? | ils restent sur le disque local | ils transitent par un service tiers |
Une seule réponse « pas local » suffit : l’ensemble n’est pas local, même si l’interface ressemble à une application de bureau.
Le test du câble débranché
Le contrôle le plus simple ne demande aucun outil : téléchargez le modèle, coupez l’accès réseau, posez votre question. Si la réponse arrive, le calcul est local. Si l’application affiche une erreur de connexion, une partie du traitement se faisait ailleurs, et il faut lire la documentation de l’éditeur pour savoir laquelle.
Le piège : le modèle « local » hébergé chez l’éditeur
Certains outils proposent désormais, dans la même liste que les modèles locaux, des modèles exécutés sur l’infrastructure de l’éditeur. La documentation d’Ollama sur les modèles cloud (nouvel onglet) le dit sans détour : les modèles cloud « ne peuvent pas tourner sans » un GPU puissant et sont « automatiquement déportés vers le service cloud d’Ollama tout en offrant les mêmes capacités que les modèles locaux » (consultée le 15/09/2026). Ils se reconnaissent au suffixe de leur nom, gpt-oss:120b-cloud dans l’exemple de la documentation, et exigent un compte sur le site de l’éditeur.
La page de questions fréquentes du même éditeur distingue clairement les deux régimes : « Ollama s’exécute localement. Nous ne voyons ni vos prompts ni vos données quand vous exécutez en local », alors que pour les modèles hébergés « nous traitons vos prompts et vos réponses pour fournir le service » (consultée le 15/09/2026). Les deux phrases sont vraies ; elles ne décrivent pas le même fonctionnement. C’est exactement le genre d’ambiguïté qu’un choix d’outil doit lever avant l’installation, pas après.
Vérifier ce qui tourne vraiment chez vous
Deux commandes répondent à la question au lieu de la supposer.
ollama psaffiche une colonnePROCESSORqui indique où le modèle a été chargé :100% GPU,100% CPU, ou une répartition du type48%/52% CPU/GPU(documentation Ollama, consultée le 15/09/2026).- Le mode local seul se désactive explicitement :
OLLAMA_NO_CLOUD=1, ou{"disable_ollama_cloud": true}dans~/.ollama/server.json. Après redémarrage, le journal doit afficherOllama cloud disabled: true.
Si le mode local seul est activé et que vos modèles continuent de répondre sans réseau, la question est réglée. Sinon, recommencez le test du câble débranché.
Erreur : croire que l’application locale suffit
Une application installée sur votre machine n’est pas une preuve de traitement local. Le client peut très bien envoyer la question à une interface distante et n’afficher que le résultat. Le lieu du calcul est une information de configuration, pas une caractéristique de l’icône.
Comment choisir un modèle selon l’usage ?
Un modèle local ne fait pas « de l’IA » : il fait une tâche précise. Choisir revient à nommer la tâche, puis à accepter la famille de modèles qui la couvre, avec ses contraintes de taille.
Texte et rédaction
Conversation, résumé, reformulation, traduction : c’est la famille la mieux servie et la plus légère. Un modèle de quelques centièmes de milliard à quelques milliards de paramètres suffit pour tester la chaîne complète sur une machine ordinaire. Attendez-vous à un résultat utilisable comme brouillon, pas comme texte publiable, c’est le sujet de la vérification, pas du choix du matériel.
Code
Les modèles orientés code existent localement, mais ils sont plus exigeants : ils doivent tenir un contexte long (le fichier, parfois plusieurs) et produire une sortie exacte. La contrainte n’est plus la mémoire seule, c’est la longueur de contexte supportée. Vérifiez ce point dans la fiche du modèle avant de l’adopter.
Image
La génération d’image locale existe, mais elle ne se pilote pas comme un modèle de texte : elle demande un pipeline dédié et, en pratique, une carte graphique. Sur une machine sans accélérateur, comptez la même chute de débit que pour le texte, en pire. Le choix se fait donc d’abord sur le matériel disponible. La demande à écrire et la revue du fichier reçu, elles, se travaillent dans générer une image avec IA.
Audio
La transcription locale est l’un des usages les plus rentables : le volume de données à faire sortir chez un tiers est important, et la tâche est bornée. Les modèles de transcription ont leur propre format et leur propre outil, distincts d’un moteur de texte.
Recherche et embeddings
Transformer des documents en vecteurs pour les retrouver ensuite est une tâche locale discrète et légère. Elle sert de brique à une recherche personnelle, sans conversation. Ne la confondez pas avec un modèle de réponse : elle ne rédige rien.
Ce qu’un modèle local ne fait pas
Aucun modèle ne « sait » ce qui n’est pas dans ses paramètres ni dans ce que vous lui donnez. Un modèle local ne remplace ni une base documentaire, ni un moteur de recherche, ni une vérification. Choisir un modèle ne dispense pas de vérifier ses réponses.
Quelles contraintes matérielles vérifier avant de choisir ?
La mémoire est la contrainte qui décide, avant la vitesse. La règle pratique : le modèle et son contexte doivent tenir ensemble dans la mémoire disponible, sinon le système bascule sur le disque et le débit s’effondre.
Ce que les éditeurs d’outils annoncent
Ces valeurs sont des recommandations d’éditeur, publiées à une date donnée, pas des mesures faites chez vous. Elles proviennent des prérequis système publiés par LM Studio (nouvel onglet) et de la prise en charge matérielle d’Ollama (nouvel onglet).
| Outil | Plateforme | Exigence annoncée | Date de consultation |
|---|---|---|---|
| LM Studio | macOS | Apple Silicon (M1/M2/M3/M4), macOS 14.0 ou plus récent, 16 Go de RAM recommandés ; 8 Go encore utilisables avec des modèles plus petits et un contexte modeste | 15/09/2026 |
| LM Studio | Windows | jeu d’instructions AVX2 requis, au moins 16 Go de RAM recommandés, au moins 4 Go de VRAM dédiée recommandés | 15/09/2026 |
| Ollama | GPU NVIDIA | compute capability 5.0 minimum, pilote 550 ou plus récent (570 ou plus récent pour les cartes de compute 5.0 à 6.2) | 15/09/2026 |
| Ollama | espace disque | paquet d’installation Linux x86_64 mesuré à 1,43 Go compressé et 2,2 Go extrait, avant tout modèle | 15/09/2026 |
La première ligne utile de ce tableau n’est pas une marque : c’est le fait que 16 Go de RAM reviennent comme recommandation chez l’éditeur qui a le plus documenté ses prérequis. En dessous, ce n’est pas impossible, c’est le nombre de modèles utilisables qui se réduit.
Accélération : ce qui change, et ce qui reste possible
Sans carte graphique compatible, le modèle tourne sur le processeur. Ce n’est pas un mode dégradé théorique : c’est un mode lent, et il faut le mesurer. Sur une machine de test à 12 cœurs virtuels sans GPU, un modèle de 0,5 milliard de paramètres a produit 12 jetons en 25,9 secondes, soit moins d’un demi-jeton par seconde (mesure du 15/09/2026, détail et sortie brute dans l’essai d’installation d’Ollama). À ce débit, une réponse de quelques paragraphes occupe plusieurs minutes.
Le projet llama.cpp (nouvel onglet), sur lequel repose une partie de cet écosystème, documente deux mécanismes utiles pour ce cas : la quantification entière de 1,5 à 8 bits, qui réduit la mémoire nécessaire, et l’inférence hybride processeur et carte graphique, qui « accélère partiellement des modèles plus grands que la VRAM totale » (page du projet, consultée le 15/09/2026). Autrement dit : on peut mélanger les deux, mais on ne peut pas promettre une vitesse sans mesurer.
Contexte et cache : deux réglages qui mangent la mémoire
La mémoire d’un modèle n’est pas seulement son poids. Le contexte, la fenêtre de texte gardée en mémoire, s’y ajoute. Ollama utilise par défaut une fenêtre de 4 096 jetons, modifiable par OLLAMA_CONTEXT_LENGTH. Le cache de ce contexte peut être quantifié via OLLAMA_KV_CACHE_TYPE : f16 par défaut, q8_0 environ la moitié de la mémoire, q4_0 environ le quart (documentation Ollama, consultée le 15/09/2026). La même documentation précise que l’effet sur la qualité dépend du modèle et de la tâche. Augmenter le contexte et garder le cache en haute précision, c’est payer deux fois.
Mesurer chez vous, puis décider
L’ordre qui évite l’achat inutile : télécharger un petit modèle, noter le poids affiché, poser une question type, chronométrer. Le serveur local d’Ollama renvoie dans sa réponse les compteurs utiles (prompt_eval_count, eval_count, eval_duration), ce qui donne un débit calculable sans outil supplémentaire. Vous saurez alors si votre machine tient votre usage, et non si elle tient le modèle le plus gros de la liste.
Erreur : dimensionner sur la taille du modèle
Choisir un modèle parce qu’il est le plus gros que sa mémoire accepte, sans mesurer le débit ni le contexte nécessaire. Le résultat est un système qui répond juste, mais trop lentement pour l’usage prévu, ou qui tronque les documents longs sans le dire.
Quelles questions poser, dans quel ordre ?
Posées dans cet ordre, ces sept questions donnent une décision que vous pouvez expliquer.
| Ordre | Question | Ce qu’une mauvaise réponse élimine |
|---|---|---|
| 1 | Le calcul doit-il rester sur ma machine, ou hors connexion ? | les modèles hébergés, même bien intégrés |
| 2 | Quelle tâche exactement : texte, code, image, audio, recherche ? | les familles de modèles hors sujet |
| 3 | Quels documents ou données seront traités, et sont-ils sensibles ? | les configurations où l’on accepte un service tiers |
| 4 | Combien de mémoire libre ai-je réellement, contexte compris ? | les modèles qui ne tiennent pas |
| 5 | Quel débit minimal mon usage tolère-t-il ? | les modèles qui tiennent mais ne répondent pas assez vite |
| 6 | Ai-je besoin du hors-ligne permanent ou occasionnel ? | les outils qui exigent un compte ou une connexion au premier lancement |
| 7 | Comment je mesure, et à quelle date je revalide ? | les choix figés sur une publicité |
Une réponse « je ne sais pas » à la question 4 ou 5 n’est pas un blocage : c’est l’instruction d’aller mesurer avant de choisir.
Ce qu’un choix local ne garantit pas
Un palmarès ne survit pas à la version suivante
Un classement de modèles est périmé à la publication suivante, et une note globale mélange des usages qui ne se comparent pas. Les questions ci-dessus survivent aux changements de version ; un palmarès, non.
Les chiffres cités sont des recommandations d’éditeur
« 16 Go recommandés » vient de la documentation d’un éditeur à une date donnée. C’est un point de départ pour votre mesure, pas une garantie que votre usage passera. Le même avertissement vaut pour les versions logicielles : une exigence de pilote ou une version d’outil change sans préavis.
Un test local ne prouve que votre configuration
Le débit cité ici a été relevé sur une machine de test précise, un matériel précis et un modèle précis. Il indique un ordre de grandeur en l’absence d’accélérateur ; il ne prédit pas le vôtre.
Ce qu’un tableau de modèles ne dit pas
Quel modèle produit les meilleurs textes pour votre tâche ne se lit pas dans un comparatif : cela se vérifie sur vos propres documents, dans votre langue, à une date donnée. Et faire tourner un modèle sur votre machine ne dispense pas de regarder le cadre juridique des données que vous lui confiez.