CyberSDF

Reprenez la main sur votre numérique

Installer Ollama sur Linux et lancer un premier modèle

Pour installer Ollama sous Linux sans toucher au système, téléchargez l’archive officielle, extrayez-la dans un dossier à vous, lancez le serveur sur un port dédié, tirez un petit modèle et vérifiez chaque étape par une commande. Tout ce qui suit a été exécuté sur une machine de test le 15/09/2026 : chaque commande est suivie de la sortie réellement obtenue, y compris ce qui a échoué.

Sommaire
  1. Ce qu’Ollama est, et ce qu’il n’est pas
  2. Prérequis, chiffrés
  3. Comment installer sans droits administrateur
  4. Premier modèle et vérification
  5. Désinstaller et nettoyer
  6. Ce que cet essai ne mesure pas

Cet essai couvre une seule voie : Linux x86_64, installation dans un dossier utilisateur, sans droits administrateur, sans carte graphique. Il ne couvre ni Windows, ni macOS, ni Docker, ni l’accélérateur GPU. La version d’Ollama observée est la 0.34.0, téléchargée le 15/09/2026 : une version ultérieure peut changer les sorties.

Ce qu’Ollama est, et ce qu’il n’est pas

Ollama est un programme qui exécute des modèles de langage sur votre machine et qui expose un serveur HTTP local. Deux morceaux, donc : un binaire en ligne de commande, et un service qui écoute par défaut sur 127.0.0.1:11434 (documentation Ollama, consultée le 15/09/2026).

Un serveur local et une ligne de commande

La ligne de commande sert à gérer les modèles (télécharger, lister, lancer). Toute la suite passe par une API HTTP documentée, à la même adresse, ce qui permet d’utiliser le même moteur depuis un autre programme. L’API n’est pas versionnée de façon stricte : la documentation annonce une compatibilité ascendante et des dépréciations rares, annoncées dans les notes de version.

Ce que l’installation n’installe pas

Ollama n’installe aucun modèle : le paquet ne contient que le moteur. Les modèles sont téléchargés ensuite, un par un, et ce sont eux qui occupent la place. Ollama n’installe pas non plus d’accélérateur : le support GPU dépend des pilotes déjà présents sur la machine. Et il n’installe pas de modèle par défaut sur votre disque : tant que vous n’avez rien tiré, il n’y a rien à exécuter.

Prérequis, chiffrés

Élément Valeur Origine
Système Linux x86_64 (aussi disponible en ARM64) documentation Ollama, 15/09/2026
Droits aucun, pour la voie de l’archive extraite dans un dossier utilisateur ; l’installateur officiel, lui, écrit dans /usr et crée un service système documentation Ollama, 15/09/2026
Espace disque, paquet 1 433 537 033 octets compressés, soit 2,2 Go extraits mesuré le 15/09/2026
Espace disque, modèle 397 Mo pour le petit modèle utilisé ici, 484 Mo une fois chargé en mémoire mesuré le 15/09/2026
Mémoire dépend du modèle et du contexte ; le contexte par défaut est de 4 096 jetons documentation Ollama, 15/09/2026
Accélérateur optionnel ; pour NVIDIA, compute capability 5.0 minimum et pilote 550 ou plus récent documentation Ollama, 15/09/2026

Sur quelle machine cet essai a été fait

Douze processeurs virtuels, aucun accélérateur : ni /dev/dri, ni nvidia-smi sur la machine. Aucun droit administrateur non plus : l’outil d’élévation refuse explicitement de s’exécuter dans cet environnement. C’est exactement le pire cas réaliste, et c’est utile : il montre ce que donne Ollama quand il n’y a rien pour l’accélérer.

Pourquoi cet essai n’utilise pas l’installateur officiel

La documentation officielle d’Ollama pour Linux (nouvel onglet) propose curl -fsSL https://ollama.com/install.sh | sh, et la même page documente un service système, un compte ollama dédié et une extraction dans /usr. Ces opérations modifient le système et exigent donc des droits d’administration : c’est leur justification, et c’est aussi ce que cet essai évite. La voie retenue ici est l’archive officielle extraite dans un dossier utilisateur. Elle ne crée ni service, ni compte, ni fichier système.

Comment installer sans droits administrateur

1. Télécharger l’archive officielle

mkdir -p ~/ollama-banc && cd ~/ollama-banc
wget -q -O ollama.tar.zst https://ollama.com/download/ollama-linux-amd64.tar.zst

Résultat observé : un fichier de 1 433 537 033 octets. Notez la taille exacte : c’est elle qui vous permettra de comparer plus tard ce que vous avez réellement téléchargé.

2. Extraire dans un dossier borné

mkdir -p root && tar --zstd -xf ollama.tar.zst -C root
du -sh root

Sortie observée : 2.2G root. L’archive contient deux dossiers : bin/ avec le binaire, et lib/ollama/ avec les bibliothèques associées. C’est cet agencement qui impose l’étape suivante.

3. Lancer le binaire extrait

LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama --version

Sortie observée :

Warning: could not connect to a running Ollama instance
Warning: client version is 0.34.0

Les deux lignes sont normales à ce stade. La seconde donne la version ; la première signale qu’aucun serveur n’écoute encore. Un binaire lancé depuis l’arborescence extraite a besoin que le chargeur trouve ses bibliothèques : sans la variable ci-dessus, le programme ne démarre pas. Ce point n’existe pas dans une installation système, où les bibliothèques sont au bon endroit.

Premier modèle et vérification

4. Démarrer le serveur

OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
  LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama serve

Le port par défaut est 11434 ; le port 11499 est utilisé ici pour ne rien prendre à d’autres services. OLLAMA_MODELS place les modèles dans notre dossier au lieu de /usr/share/ollama/.ollama/models, leur emplacement par défaut sous Linux selon la documentation.

Vérification, depuis un autre terminal :

curl -s http://127.0.0.1:11499/api/version

Sortie observée : {"version":"0.34.0"}. Le serveur répond, et la version de l’API correspond à celle du binaire.

5. Tirer un petit modèle

OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
  LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama pull qwen2.5:0.5b

Sortie observée, dernière ligne : success. Le téléchargement a porté sur 397 Mo. Cette étape exige une connexion ; elle est la seule de l’essai dans ce cas.

6. Lister ce qui est installé

OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
  LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama list

Sortie observée :

NAME            ID              SIZE      MODIFIED
qwen2.5:0.5b    a8b0c5157701    397 MB    5 seconds ago

7. Poser une question

OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
  LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama run qwen2.5:0.5b \\
  "Réponds en une seule phrase courte : à quoi sert la commande ls ?"

Sortie observée, la dernière ligne :

La commande `ls` est utile pour accéder à la liste des fichiers et d'objets
d'objets, ainsi que l'accès aux dossiers.

La réponse est fausse en français (« d’objets d’objets ») et approximative sur le fond. Ce n’est pas une anomalie du montage : c’est le comportement d’un modèle de 0,5 milliard de paramètres sur une question rédigée dans une autre langue que l’essentiel de ses données d’entraînement. La chaîne technique fonctionne ; la qualité du texte, non. Gardez cette distinction en tête pour la suite. Une réponse produite localement se vérifie comme une autre, affirmation par affirmation : vérifier une réponse IA avant de la réutiliser.

8. Mesurer le débit réel

Passer par l’API renvoie des compteurs exploitables. Avec un petit fichier de requête req.json contenant {"model":"qwen2.5:0.5b","prompt":"Bonjour","stream":false} :

curl -s -H "Content-Type: application/json" \\
  --data-binary @req.json http://127.0.0.1:11499/api/generate

Champs observés dans la réponse :

Champ Valeur observée Lecture
response Bonjour! Comment puis-je vous aider aujourd'hui ? réponse produite
total_duration 28 365 758 956 ns, soit 28,4 s durée de l’appel complet
load_duration 4 350 332 ns, soit 4,4 ms modèle déjà chargé
prompt_eval_count 30 jetons prompt évalué
eval_count 12 jetons jetons produits
eval_duration 25 889 537 000 ns, soit 25,9 s temps de production

Le débit se calcule : 12 jetons en 25,9 secondes, soit environ 0,46 jeton par seconde. Le journal du serveur imprime pour le même appel une ligne de temps qui affiche 0,42 jeton/s : la durée d’évaluation est identique dans les deux sources (25 889,54 ms), mais cette ligne la rapporte à 11 jetons quand eval_count en annonce 12. Les deux valeurs sont données ici pour qu’aucune contradiction n’apparaisse si vous relancez la mesure. Pour confirmer le lieu du calcul :

OLLAMA_MODELS=$PWD/models OLLAMA_HOST=127.0.0.1:11499 \\
  LD_LIBRARY_PATH=$PWD/root/lib/ollama ./root/bin/ollama ps

Sortie observée :

NAME            ID              SIZE      PROCESSOR    CONTEXT    UNTIL
qwen2.5:0.5b    a8b0c5157701    484 MB    100% CPU     4096       3 minutes from now

100% CPU : rien n’a été accéléré, et le contexte effectivement chargé est de 4 096 jetons, la valeur par défaut documentée. Ces deux informations sont celles qui décident de l’usage possible.

Désinstaller et nettoyer

9. Arrêter le serveur

Le serveur est un processus ordinaire lancé par vous : interrompez-le dans son terminal, ou terminez son processus par son identifiant. Aucun service système n’a été créé par cette voie, donc rien à désactiver.

10. Supprimer paquet et modèles

du -sh ~/ollama-banc/root ~/ollama-banc/models
rm -rf ~/ollama-banc

Résultat observé avant suppression (sur une autre machine où le banc avait été placé sous /tmp) : 2.2G pour root, 380M pour models. Supprimer le dossier supprime le moteur et les modèles ensemble. C’est l’intérêt d’une installation bornée : la désinstallation est une suppression de dossier, sans résidu ailleurs. Vérifiez le chemin deux fois avant la commande : il doit correspondre à celui que vous avez créé à l’étape 1.

Le cas négatif observé : une requête abandonnée

Le premier appel à l’API a demandé une réponse libre de quelques phrases. Le client a interrompu au bout de 120 secondes ; le journal du serveur a enregistré une réponse d’erreur sur cet appel (500 sur POST /api/generate, durée 2 min 0 s) et l’annulation de la tâche en cours. C’est le comportement attendu d’un client qui abandonne, pas une panne du moteur ; mais sur CPU sans accélération, une question ouverte peut très largement dépasser une minute. Dimensionnez les délais d’attente en conséquence, ou posez des questions courtes.

Ce que cet essai ne mesure pas

Ce que l’essai ne prouve pas

Il prouve qu’Ollama 0.34.0 s’installe, démarre, télécharge un modèle et répond sur cette machine, à cette date. Il ne prouve rien de général sur les performances d’Ollama, sur les autres modèles, ni sur une machine avec accélérateur.

Un débit sans accélérateur, et pas un débit de référence

Moins d’un demi-jeton par seconde pour un modèle de 0,5 milliard de paramètres : ce chiffre est une mesure isolée sur douze processeurs virtuels. Il indique l’ordre de grandeur à attendre sans GPU, rien au-delà. Avec un accélérateur compatible, la mécanique est différente.

Une seule voie d’installation documentée ici

L’installation système, avec service et compte dédiés, n’a pas été exécutée. Sa documentation est citée, pas essayée. Le mode Docker, l’ARM64, le support ROCm pour AMD et la mise à jour d’une version existante ne sont pas couverts.

La qualité du modèle n’est pas la qualité du montage

La réponse erronée du petit modèle ne dit rien de la chaîne technique : elle dit qu’un modèle minuscule ne rédige pas. Choisir un modèle plus grand, c’est payer en mémoire, en contexte et en débit. La méthode est dans choisir une IA locale.

Versions et péremption

Les sorties datées du 15/09/2026 correspondent à la version 0.34.0. Les commandes et les messages changent d’une version à l’autre. Si une sortie diffère de celle montrée ici, votre version n’est plus la nôtre : vérifiez la documentation officielle avant de conclure à une erreur.