Installer Ollama sur Linux et lancer un premier modèle
Pour installer Ollama sous Linux sans toucher au système, téléchargez l’archive officielle, extrayez-la dans un dossier à vous, lancez le serveur sur un port dédié, tirez un petit modèle et vérifiez chaque étape par une commande. Tout ce qui suit a été exécuté sur une machine de test le 15/09/2026 : chaque commande est suivie de la sortie réellement obtenue, y compris ce qui a échoué.
Sommaire

Cet essai couvre une seule voie : Linux x86_64, installation dans un dossier utilisateur, sans droits administrateur, sans carte graphique. Il ne couvre ni Windows, ni macOS, ni Docker, ni l’accélérateur GPU. La version d’Ollama observée est la 0.34.0, téléchargée le 15/09/2026 : une version ultérieure peut changer les sorties.
Ce qu’Ollama est, et ce qu’il n’est pas
Ollama est un programme qui exécute des modèles de langage sur votre machine et qui expose un serveur HTTP local. Deux morceaux, donc : un binaire en ligne de commande, et un service qui écoute par défaut sur 127.0.0.1:11434 (documentation Ollama, consultée le 15/09/2026).
Un serveur local et une ligne de commande
La ligne de commande sert à gérer les modèles (télécharger, lister, lancer). Toute la suite passe par une API HTTP documentée, à la même adresse, ce qui permet d’utiliser le même moteur depuis un autre programme. L’API n’est pas versionnée de façon stricte : la documentation annonce une compatibilité ascendante et des dépréciations rares, annoncées dans les notes de version.
Ce que l’installation n’installe pas
Ollama n’installe aucun modèle : le paquet ne contient que le moteur. Les modèles sont téléchargés ensuite, un par un, et ce sont eux qui occupent la place. Ollama n’installe pas non plus d’accélérateur : le support GPU dépend des pilotes déjà présents sur la machine. Et il n’installe pas de modèle par défaut sur votre disque : tant que vous n’avez rien tiré, il n’y a rien à exécuter.
Prérequis, chiffrés
| Élément | Valeur | Origine |
|---|---|---|
| Système | Linux x86_64 (aussi disponible en ARM64) | documentation Ollama, 15/09/2026 |
| Droits | aucun, pour la voie de l’archive extraite dans un dossier utilisateur ; l’installateur officiel, lui, écrit dans /usr et crée un service système |
documentation Ollama, 15/09/2026 |
| Espace disque, paquet | 1 433 537 033 octets compressés, soit 2,2 Go extraits | mesuré le 15/09/2026 |
| Espace disque, modèle | 397 Mo pour le petit modèle utilisé ici, 484 Mo une fois chargé en mémoire | mesuré le 15/09/2026 |
| Mémoire | dépend du modèle et du contexte ; le contexte par défaut est de 4 096 jetons | documentation Ollama, 15/09/2026 |
| Accélérateur | optionnel ; pour NVIDIA, compute capability 5.0 minimum et pilote 550 ou plus récent | documentation Ollama, 15/09/2026 |
Sur quelle machine cet essai a été fait
Douze processeurs virtuels, aucun accélérateur : ni /dev/dri, ni nvidia-smi sur la machine. Aucun droit administrateur non plus : l’outil d’élévation refuse explicitement de s’exécuter dans cet environnement. C’est exactement le pire cas réaliste, et c’est utile : il montre ce que donne Ollama quand il n’y a rien pour l’accélérer.
Pourquoi cet essai n’utilise pas l’installateur officiel
La documentation officielle d’Ollama pour Linux (nouvel onglet) propose curl -fsSL https://ollama.com/install.sh | sh, et la même page documente un service système, un compte ollama dédié et une extraction dans /usr. Ces opérations modifient le système et exigent donc des droits d’administration : c’est leur justification, et c’est aussi ce que cet essai évite. La voie retenue ici est l’archive officielle extraite dans un dossier utilisateur. Elle ne crée ni service, ni compte, ni fichier système.
Comment installer sans droits administrateur
1. Télécharger l’archive officielle
mkdir -p ~/ollama-banc && cd ~/ollama-banc
wget -q -O ollama.tar.zst https://ollama.com/download/ollama-linux-amd64.tar.zst
Résultat observé : un fichier de 1 433 537 033 octets. Notez la taille exacte : c’est elle qui vous permettra de comparer plus tard ce que vous avez réellement téléchargé.
2. Extraire dans un dossier borné
mkdir -p root && tar --zstd -xf ollama.tar.zst -C root
du -sh root
Sortie observée : 2.2G root. L’archive contient deux dossiers : bin/ avec le binaire, et lib/ollama/ avec les bibliothèques associées. C’est cet agencement qui impose l’étape suivante.
3. Lancer le binaire extrait
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama --version
Sortie observée :
Warning: could not connect to a running Ollama instance
Warning: client version is 0.34.0
Les deux lignes sont normales à ce stade. La seconde donne la version ; la première signale qu’aucun serveur n’écoute encore. Un binaire lancé depuis l’arborescence extraite a besoin que le chargeur trouve ses bibliothèques : sans la variable ci-dessus, le programme ne démarre pas. Ce point n’existe pas dans une installation système, où les bibliothèques sont au bon endroit.
Premier modèle et vérification
4. Démarrer le serveur
OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama serve
Le port par défaut est 11434 ; le port 11499 est utilisé ici pour ne rien prendre à d’autres services. OLLAMA_MODELS place les modèles dans notre dossier au lieu de /usr/share/ollama/.ollama/models, leur emplacement par défaut sous Linux selon la documentation.
Vérification, depuis un autre terminal :
curl -s http://127.0.0.1:11499/api/version
Sortie observée : {"version":"0.34.0"}. Le serveur répond, et la version de l’API correspond à celle du binaire.
5. Tirer un petit modèle
OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama pull qwen2.5:0.5b
Sortie observée, dernière ligne : success. Le téléchargement a porté sur 397 Mo. Cette étape exige une connexion ; elle est la seule de l’essai dans ce cas.
6. Lister ce qui est installé
OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama list
Sortie observée :
NAME ID SIZE MODIFIED
qwen2.5:0.5b a8b0c5157701 397 MB 5 seconds ago
7. Poser une question
OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama run qwen2.5:0.5b \\
"Réponds en une seule phrase courte : à quoi sert la commande ls ?"
Sortie observée, la dernière ligne :
La commande `ls` est utile pour accéder à la liste des fichiers et d'objets
d'objets, ainsi que l'accès aux dossiers.
La réponse est fausse en français (« d’objets d’objets ») et approximative sur le fond. Ce n’est pas une anomalie du montage : c’est le comportement d’un modèle de 0,5 milliard de paramètres sur une question rédigée dans une autre langue que l’essentiel de ses données d’entraînement. La chaîne technique fonctionne ; la qualité du texte, non. Gardez cette distinction en tête pour la suite. Une réponse produite localement se vérifie comme une autre, affirmation par affirmation : vérifier une réponse IA avant de la réutiliser.
8. Mesurer le débit réel
Passer par l’API renvoie des compteurs exploitables. Avec un petit fichier de requête req.json contenant {"model":"qwen2.5:0.5b","prompt":"Bonjour","stream":false} :
curl -s -H "Content-Type: application/json" \\
--data-binary @req.json http://127.0.0.1:11499/api/generate
Champs observés dans la réponse :
| Champ | Valeur observée | Lecture |
|---|---|---|
response |
Bonjour! Comment puis-je vous aider aujourd'hui ? |
réponse produite |
total_duration |
28 365 758 956 ns, soit 28,4 s | durée de l’appel complet |
load_duration |
4 350 332 ns, soit 4,4 ms | modèle déjà chargé |
prompt_eval_count |
30 jetons | prompt évalué |
eval_count |
12 jetons | jetons produits |
eval_duration |
25 889 537 000 ns, soit 25,9 s | temps de production |
Le débit se calcule : 12 jetons en 25,9 secondes, soit environ 0,46 jeton par seconde. Le journal du serveur imprime pour le même appel une ligne de temps qui affiche 0,42 jeton/s : la durée d’évaluation est identique dans les deux sources (25 889,54 ms), mais cette ligne la rapporte à 11 jetons quand eval_count en annonce 12. Les deux valeurs sont données ici pour qu’aucune contradiction n’apparaisse si vous relancez la mesure. Pour confirmer le lieu du calcul :
OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama ps
Sortie observée :
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen2.5:0.5b a8b0c5157701 484 MB 100% CPU 4096 3 minutes from now
100% CPU : rien n’a été accéléré, et le contexte effectivement chargé est de 4 096 jetons, la valeur par défaut documentée. Ces deux informations sont celles qui décident de l’usage possible.
Désinstaller et nettoyer
9. Arrêter le serveur
Le serveur est un processus ordinaire lancé par vous : interrompez-le dans son terminal, ou terminez son processus par son identifiant. Aucun service système n’a été créé par cette voie, donc rien à désactiver.
10. Supprimer paquet et modèles
du -sh ~/ollama-banc/root ~/ollama-banc/models
rm -rf ~/ollama-banc
Résultat observé avant suppression (sur une autre machine où le banc avait été placé sous /tmp) : 2.2G pour root, 380M pour models. Supprimer le dossier supprime le moteur et les modèles ensemble. C’est l’intérêt d’une installation bornée : la désinstallation est une suppression de dossier, sans résidu ailleurs. Vérifiez le chemin deux fois avant la commande : il doit correspondre à celui que vous avez créé à l’étape 1.
Le cas négatif observé : une requête abandonnée
Le premier appel à l’API a demandé une réponse libre de quelques phrases. Le client a interrompu au bout de 120 secondes ; le journal du serveur a enregistré une réponse d’erreur sur cet appel (500 sur POST /api/generate, durée 2 min 0 s) et l’annulation de la tâche en cours. C’est le comportement attendu d’un client qui abandonne, pas une panne du moteur ; mais sur CPU sans accélération, une question ouverte peut très largement dépasser une minute. Dimensionnez les délais d’attente en conséquence, ou posez des questions courtes.
Ce que cet essai ne mesure pas
Ce que l’essai ne prouve pas
Il prouve qu’Ollama 0.34.0 s’installe, démarre, télécharge un modèle et répond sur cette machine, à cette date. Il ne prouve rien de général sur les performances d’Ollama, sur les autres modèles, ni sur une machine avec accélérateur.
Un débit sans accélérateur, et pas un débit de référence
Moins d’un demi-jeton par seconde pour un modèle de 0,5 milliard de paramètres : ce chiffre est une mesure isolée sur douze processeurs virtuels. Il indique l’ordre de grandeur à attendre sans GPU, rien au-delà. Avec un accélérateur compatible, la mécanique est différente.
Une seule voie d’installation documentée ici
L’installation système, avec service et compte dédiés, n’a pas été exécutée. Sa documentation est citée, pas essayée. Le mode Docker, l’ARM64, le support ROCm pour AMD et la mise à jour d’une version existante ne sont pas couverts.
La qualité du modèle n’est pas la qualité du montage
La réponse erronée du petit modèle ne dit rien de la chaîne technique : elle dit qu’un modèle minuscule ne rédige pas. Choisir un modèle plus grand, c’est payer en mémoire, en contexte et en débit. La méthode est dans choisir une IA locale.
Versions et péremption
Les sorties datées du 15/09/2026 correspondent à la version 0.34.0. Les commandes et les messages changent d’une version à l’autre. Si une sortie diffère de celle montrée ici, votre version n’est plus la nôtre : vérifiez la documentation officielle avant de conclure à une erreur.