Installer Ollama en 2026 : le guide complet (Windows, Mac, Linux)

Ollama permet d’installer une IA en local et d’exécuter des modèles d’IA générative directement sur votre machine, sans cloud ni abonnement. Vous pouvez l’utiliser en ligne de commande, l’exposer comme API locale, puis le connecter à des interfaces web ou à vos applications (Python, JavaScript, outils d’API). Ce guide 2026 vous montre pas à pas comment installer Ollama sur Windows, macOS et Linux, télécharger des modèles, choisir la bonne taille selon votre RAM, et tout intégrer dans vos workflows.

Pour aller plus loin sur le choix du matériel, consultez aussi notre guide IA locale : quel PC choisir en 2026 et notre comparatif 16, 32 ou 64 Go de RAM pour une IA locale.

Sommaire

Prérequis : ce qu’il faut avant d’installer Ollama

Avant de commencer, assurez-vous d’avoir :

  • Un OS compatible : Windows 10/11 récent, macOS ou une distribution Linux moderne.
  • De la RAM : 8 Go suffisent pour démarrer, mais 16 Go sont recommandés (davantage pour les gros modèles). Voir notre article dédié à la RAM pour l’IA locale.
  • Un GPU (optionnel mais conseillé) : NVIDIA CUDA ou AMD compatible. Ollama fonctionne aussi sur CPU, mais plus lentement. Pour comprendre les différences, lisez CPU, GPU et NPU pour l’IA.

Comment installer Ollama sur Windows, macOS et Linux

Installer Ollama sur Windows

  1. Téléchargez l’installateur Windows depuis la page de téléchargement officielle.
  2. Exécutez le fichier .exe et suivez l’assistant d’installation.
  3. Ouvrez PowerShell et vérifiez l’installation :
ollama -v

Installer Ollama sur macOS

  1. Téléchargez Ollama.app.
  2. Déplacez l’application dans Applications puis ouvrez-la une première fois.
  3. Dans le Terminal, vérifiez l’accès à la CLI :
ollama -v

Sur les Mac Apple Silicon (M1 à M4), Ollama v0.30 utilise désormais le moteur MLX, qui améliore nettement les performances sur les modèles compatibles.

Installer Ollama sur Linux

  1. Ouvrez un terminal.
  2. Exécutez le script officiel :
curl -fsSL https://ollama.com/install.sh | sh
  1. Vérifiez l’installation :
ollama -v

Télécharger et lancer un modèle avec la CLI

Ollama télécharge les modèles à la demande, puis les conserve localement sur votre machine.

Lancer un modèle (téléchargement + exécution)

Exemple avec un modèle léger et récent :

ollama run llama3.2
  • Au premier lancement, le modèle est téléchargé.
  • Vous obtenez ensuite un prompt du type « Send a message ».
  • Pour terminer la session : Ctrl+D ou Ctrl+C.

Commandes Ollama utiles

  • Lister les modèles installés : ollama list
  • Voir les modèles en cours d’exécution : ollama ps
  • Afficher les détails d’un modèle : ollama show llama3.2
  • Supprimer un modèle : ollama rm llama3.2

Lancer un autre modèle :

ollama run gpt-oss:20b
ollama run qwen3:8b
ollama run deepseek-r1

Quel modèle Ollama choisir selon votre RAM ? (2026)

La taille du modèle influe directement sur la vitesse, la consommation mémoire et la qualité. En pratique, commencez petit, puis montez en gamme si votre matériel le permet. Voici les repères à jour pour 2026 :

Catégorie Modèles conseillés (2026) Mémoire indicative Pour qui ?
Légers llama3.2:1b, gemma3:1b, qwen3:1.7b, phi4-mini ~1 à 3 Go Démarrer, tester, machines modestes
Intermédiaires gpt-oss:20b, qwen3:8b, mistral, gemma3, llama3.1:8b ~14 à 20 Go Le meilleur équilibre qualité/perf sur un GPU 16 Go
Coding qwen3-coder:30b, devstral-small:24b ~14 à 19 Go Assistance au code, contexte 256K
Très gros gpt-oss:120b, llama4:scout, deepseek-r1:70b 60 Go+ de VRAM Workstations puissantes / multi-GPU

En 2026, gpt-oss:20b (le modèle open-weight d’OpenAI) est souvent le meilleur point d’entrée « sérieux » : il tient sur 16 Go de RAM tout en offrant un excellent niveau de raisonnement. Pour choisir votre configuration, consultez notre guide meilleure config PC pour l’IA locale.

Utiliser Ollama comme API locale (HTTP)

Ollama expose une API HTTP en local, généralement sur http://localhost:11434.

Démarrer le serveur Ollama

Le serveur démarre souvent automatiquement au lancement d’un modèle. Sinon :

ollama serve

Exemple : endpoint /api/generate

Requête simple (sans streaming) :

curl --location --request POST 'http://localhost:11434/api/generate' \
--header 'Content-Type: application/json' \
--data-raw '{
  "model": "llama3.2",
  "prompt": "Pourquoi le ciel est-il bleu ?",
  "stream": false
}'
  • "stream": true renvoie les tokens au fil de l’eau (streaming).

Exemple : endpoint /api/chat (multi-messages)

Pour des conversations multi-tours, utilisez /api/chat avec une structure de messages :

  • role : system / user / assistant
  • content : le texte du message

C’est l’approche à privilégier pour des chatbots, des assistants techniques ou des workflows « agent ».

CPU, GPU et performances : optimiser Ollama

Ollama peut exécuter un modèle :

  • entièrement sur CPU (plus lent) ;
  • entièrement sur GPU si le modèle tient en VRAM ;
  • en mode hybride (répartition CPU/GPU).

Bonnes pratiques :

  • Mettre à jour les pilotes GPU. Les cartes RTX 50-series gèrent nativement le format MXFP4 utilisé par gpt-oss.
  • Choisir une taille de modèle cohérente avec votre VRAM.
  • Éviter les modèles ultra-lourds sur des cartes à faible VRAM.

Cas avancés :

  • Le paramètre num_gpu peut influencer la répartition sur le GPU.
  • Sur les rigs AMD multi-GPU, limitez les GPU visibles via ROCR_VISIBLE_DEVICES.
  • Sur certains laptops Linux avec iGPU, augmenter la mémoire allouée à l’iGPU dans le BIOS peut aider.

Ajouter une interface graphique : Web UI compatibles Ollama

Vous n’êtes pas obligé de rester dans le terminal : plusieurs interfaces se branchent sur l’API d’Ollama.

  • Ollama Desktop : application native (macOS/Windows) pour gérer modèles et chat.
  • Open WebUI : interface web locale (souvent via Docker) connectée à Ollama.
  • LM Studio, SillyTavern, etc. : front-ends compatibles avec des endpoints Ollama.

Exemple de configuration avec Open WebUI

  1. Installez Open WebUI (Docker ou installation directe).
  2. Dans les paramètres, définissez l’URL backend :
    • http://host.docker.internal:11434 (si WebUI tourne dans Docker) ;
    • ou l’IP/port de votre machine pour un accès distant.
  3. Sélectionnez un modèle (ex. llama3.2) et discutez dans le navigateur.

Intégrer Ollama dans vos applications et déboguer vos requêtes

Considérez Ollama comme un backend local « type OpenAI » :

  • De nombreux SDK Python et JavaScript peuvent pointer vers l’API Ollama en changeant simplement l’URL de base : http://localhost:11434.

Débogage rapide avec Postman ou Apidog

  1. Copiez un exemple cURL (comme celui de /api/generate).
  2. Collez-le dans votre client API (Postman, Apidog).
  3. Testez la réponse JSON, le streaming, puis ajustez prompt et paramètres.

Conclusion : Ollama, une IA locale simple à déployer

Avec Ollama, vous pouvez installer une IA en local en quelques minutes, télécharger des modèles à la demande, exposer un endpoint HTTP et brancher des interfaces modernes ou vos propres applications. Le point clé reste de choisir un modèle adapté à votre RAM/VRAM : commencez par un modèle léger ou intermédiaire comme gpt-oss:20b, puis montez en gamme si vos ressources le permettent. Pour aller plus loin, découvrez comment installer Mistral AI en local.

FAQ : installer et utiliser Ollama

Ollama est-il gratuit ?

Oui. Ollama est un logiciel open source et gratuit. Les modèles téléchargés tournent localement, sans coût par requête ni abonnement.

Quelle configuration minimale pour faire tourner Ollama ?

Le plancher est de 8 Go de RAM sans GPU, mais 16 Go et un GPU récent offrent une bien meilleure expérience. La taille du modèle doit rester cohérente avec votre mémoire disponible.

Ollama fonctionne-t-il sans GPU ?

Oui, Ollama peut exécuter un modèle entièrement sur CPU. C’est plus lent, mais parfaitement utilisable avec des modèles légers comme llama3.2:1b ou gemma3:1b.

Quel est le meilleur modèle Ollama en 2026 ?

Pour un usage général sur 16 Go, gpt-oss:20b est un excellent choix. Pour le code, qwen3-coder:30b. Pour démarrer sur une petite machine, un modèle léger comme qwen3:1.7b.

Les données envoyées à Ollama sont-elles privées ?

Oui. Comme tout s’exécute en local sur votre machine, vos prompts et vos données ne quittent pas votre ordinateur, contrairement aux services d’IA en cloud.


techpi avatar Albert
Albert

Journaliste tech depuis 2013, je suis Albert et je décrypte l'actualité high-tech pour la rendre claire et utile au quotidien. Spécialisé dans le hardware, les objets connectés et le gaming, je teste également les logiciels et les outils d'intelligence artificielle qui changent nos usages. Aussi fasciné par l'écosystème Apple que par les configurations PC les plus underground. Passé par plusieurs rédactions de référence comme MacPlus et Phonandroid, je mets cette expérience au service de tests transparents, impartiaux et ancrés dans un usage 100 % réel.
Contactez : contact@techpi.fr

Articles: 592