Installer et utiliser Ollama : guide complet pour lancer une IA en local en 2026

Ollama permet d’installer et d’utiliser une intelligence artificielle directement sur son PC ou son Mac, sans envoyer obligatoirement ses données vers un service cloud. En 2026, l’outil ne se limite plus au terminal : Ollama propose désormais une application graphique sur Windows et macOS, prend en charge les modèles multimodaux, peut servir d’API locale et se connecter à des outils comme Claude Code, Codex ou Open WebUI. Voici comment installer Ollama, choisir le bon modèle et lancer une IA locale sur Windows, macOS ou Linux.

Dernière mise à jour : 27 septembre 2026.

Pour choisir votre matériel, consultez également notre guide quel PC choisir pour une IA locale en 2026 et notre comparatif 16, 32 ou 64 Go de RAM pour l’IA locale.

Ce qu’il faut retenir

  • Ollama fonctionne sur Windows, macOS et Linux.
  • Une interface graphique est intégrée sur macOS et Windows.
  • Les modèles peuvent fonctionner entièrement en local et hors ligne.
  • Ollama expose une API locale sur le port 11434.
  • Les API compatibles OpenAI et Anthropic facilitent l’intégration dans d’autres applications.
  • gpt-oss:20b est un bon modèle généraliste pour une machine suffisamment équipée.
  • Gemma 4 et Muse Glimmer permettent également d’analyser des images.
  • Ollama propose désormais aussi des modèles cloud, mais leur utilisation reste facultative.

Qu’est-ce qu’Ollama ?

Ollama est un outil permettant de télécharger et d’exécuter des modèles d’intelligence artificielle sur son propre ordinateur.

Une fois un modèle installé, les calculs peuvent être effectués directement par votre CPU, votre GPU ou la mémoire unifiée d’un Mac Apple Silicon.

Ollama peut être utilisé de plusieurs façons :

  • avec son application graphique ;
  • depuis le Terminal ou PowerShell ;
  • comme serveur API local ;
  • avec Open WebUI ;
  • dans des applications Python ou JavaScript ;
  • avec des agents de programmation comme Claude Code, Codex ou OpenCode.

Ollama propose également un service cloud facultatif pour exécuter des modèles beaucoup trop volumineux pour un ordinateur personnel. Ce guide se concentre principalement sur l’utilisation locale.

Quelle configuration faut-il pour Ollama ?

Ollama lui-même est relativement léger. C’est surtout le modèle choisi qui détermine la quantité de mémoire nécessaire.

Mémoire disponible Modèles adaptés Usage
8 Go Phi-4 Mini, Qwen 3.5 4B Chat léger, tests, petites tâches
16 Go Qwen 3.5 9B, Gemma 4 12B, gpt-oss 20B avec peu de marge Usage général
24 à 32 Go gpt-oss 20B, Qwen3-Coder 30B, Muse Glimmer 30B Raisonnement, multimodal, code
64 Go et plus Modèles 30B à 70B et plus Workstation et gros modèles locaux

Ces chiffres sont des repères. La quantité réellement nécessaire dépend de la quantification, de la fenêtre de contexte et de la mémoire utilisée par le système.

Par exemple, gpt-oss:20b représente environ 14 Go dans Ollama. OpenAI indique que ce modèle peut fonctionner avec 16 Go de mémoire, mais une machine de 24 ou 32 Go laisse évidemment davantage de marge pour le système et le contexte.

Installer Ollama sur Windows

Ollama nécessite actuellement Windows 10 ou une version plus récente.

La méthode la plus simple consiste à télécharger l’application depuis :

Télécharger Ollama pour Windows

Il est également possible de l’installer directement depuis PowerShell :

irm https://ollama.com/install.ps1 | iex

Une fois l’installation terminée, ouvrez PowerShell et vérifiez qu’Ollama répond :

ollama --version

Installer Ollama sur macOS

Sur Mac, téléchargez l’application depuis le site officiel puis placez-la dans le dossier Applications.

Sur les Mac Apple Silicon, Ollama bénéficie désormais d’un moteur basé sur MLX, le framework d’apprentissage automatique développé par Apple.

Cette architecture exploite directement la mémoire unifiée des puces Apple Silicon et améliore fortement les performances de certains modèles optimisés.

Vous pouvez vérifier l’installation dans le Terminal :

ollama --version

Pour certains modèles optimisés MLX, Ollama propose désormais des variantes dédiées. Par exemple :

ollama run muse-glimmer:30b-mlx

Installer Ollama sur Linux

Sur Linux, ouvrez un terminal et utilisez le script officiel :

curl -fsSL https://ollama.com/install.sh | sh

Vérifiez ensuite l’installation :

ollama --version

Ollama prend en charge l’accélération GPU sur de nombreux matériels NVIDIA et AMD. Depuis Ollama 0.30, Vulkan est également activé par défaut, ce qui élargit la compatibilité avec certains GPU AMD et Intel.

L’application Ollama permet désormais d’éviter le terminal

C’est l’une des principales évolutions par rapport aux anciennes versions d’Ollama.

Sur Windows et macOS, l’application permet désormais de télécharger un modèle puis de discuter directement avec lui sans utiliser de ligne de commande.

Il est également possible de glisser-déposer certains fichiers dans une conversation, notamment :

  • des fichiers texte ;
  • des documents PDF ;
  • du code ;
  • des images lorsque le modèle est multimodal.

Le terminal reste néanmoins particulièrement pratique pour automatiser Ollama ou l’intégrer à d’autres logiciels.

Télécharger et lancer son premier modèle

La commande principale est extrêmement simple :

ollama run nom-du-modele

Par exemple, pour lancer le modèle open-weight d’OpenAI :

ollama run gpt-oss:20b

Lors du premier lancement, Ollama télécharge automatiquement les fichiers nécessaires. Les lancements suivants utilisent la copie stockée localement.

Pour une machine moins puissante, vous pouvez essayer :

ollama run phi4-mini

ou :

ollama run qwen3.5:4b

Quels modèles Ollama choisir en septembre 2026 ?

Modèle Taille Ollama approximative Usage conseillé
Phi-4 Mini 2,5 Go Petit modèle rapide
Qwen 3.5 9B 6,6 Go Usage général et multimodal
Gemma 4 12B 7,6 Go Texte, images et raisonnement
gpt-oss 20B 14 Go Raisonnement et outils
Qwen3-Coder 30B 19 Go Programmation et agents de code
Muse Glimmer 30B 18 Go environ Agents, outils et analyse d’images

Pour un utilisateur disposant de 16 à 32 Go de mémoire, gpt-oss 20B, Gemma 4 12B et Qwen 3.5 constituent d’excellents points de départ selon les usages.

Les commandes Ollama à connaître

Afficher les modèles installés :

ollama list

Voir les modèles actuellement chargés en mémoire :

ollama ps

Afficher les informations d’un modèle :

ollama show gpt-oss:20b

Télécharger un modèle sans le lancer :

ollama pull gpt-oss:20b

Supprimer un modèle :

ollama rm gpt-oss:20b

Utiliser Ollama comme API locale

Ollama expose par défaut son API sur :

http://localhost:11434

Pour démarrer manuellement le serveur :

ollama serve

Exemple avec l’API native Ollama

curl http://localhost:11434/api/chat \
  -d '{
    "model": "gpt-oss:20b",
    "messages": [
      {
        "role": "user",
        "content": "Explique simplement ce qu’est un réseau neuronal."
      }
    ],
    "stream": false
  }'

Utiliser l’API compatible OpenAI

Ollama propose également une API compatible avec le format utilisé par de nombreuses applications OpenAI.

L’adresse devient :

http://localhost:11434/v1

Exemple :

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-oss:20b",
    "messages": [
      {
        "role": "user",
        "content": "Pourquoi le ciel est-il bleu ?"
      }
    ]
  }'

Cette compatibilité permet d’utiliser de nombreux logiciels prévus à l’origine pour l’API OpenAI en changeant simplement l’adresse du serveur.

Utiliser Ollama avec Claude Desktop et les agents de code

Ollama est devenu beaucoup plus intéressant pour les développeurs en 2026.

La commande ollama launch permet de configurer automatiquement plusieurs outils de programmation pour utiliser un modèle local ou cloud.

Par exemple :

ollama launch claude --model gpt-oss:20b

Pour OpenCode :

ollama launch opencode --model qwen3-coder:30b

Ollama peut également fonctionner avec Codex et plusieurs autres outils d’agents de programmation.

Depuis août 2026, Claude Desktop peut lui aussi utiliser Ollama comme fournisseur tiers. L’intégration peut être activée directement depuis les réglages de l’application Ollama.

Ajouter Open WebUI

L’application officielle d’Ollama suffit désormais pour la plupart des usages simples.

Open WebUI reste néanmoins intéressant pour créer une interface web plus complète, gérer plusieurs utilisateurs, organiser des conversations ou utiliser Ollama depuis un navigateur.

Si Open WebUI fonctionne dans Docker, il peut généralement accéder à Ollama via :

http://host.docker.internal:11434

Pour un usage strictement personnel sur Windows ou Mac, il n’est cependant plus indispensable d’installer Open WebUI simplement pour obtenir une interface graphique.

Comment améliorer les performances d’Ollama ?

Le facteur principal reste la quantité de mémoire disponible.

Un modèle entièrement chargé dans la VRAM du GPU sera généralement beaucoup plus rapide qu’un modèle réparti entre GPU et RAM système.

Quelques principes restent utiles :

  • utiliser un modèle adapté à la quantité de RAM ou VRAM disponible ;
  • éviter des fenêtres de contexte énormes lorsque ce n’est pas nécessaire ;
  • maintenir les pilotes graphiques à jour ;
  • privilégier les variantes MLX sur les Mac Apple Silicon lorsqu’elles sont disponibles ;
  • utiliser un modèle plus petit plutôt qu’un énorme modèle qui fonctionne principalement sur CPU.

Depuis 2026, Ollama bénéficie également d’importantes optimisations NVIDIA et de Vulkan pour davantage de GPU AMD et Intel.

Les données restent-elles vraiment privées ?

Oui, lorsque vous utilisez un modèle entièrement local.

Dans ce cas, le modèle et son exécution restent sur votre ordinateur. Une connexion Internet n’est plus nécessaire une fois le modèle téléchargé.

Il faut toutefois distinguer cette utilisation des nouveaux modèles cloud Ollama.

Un modèle dont le nom comporte par exemple :cloud utilise les serveurs d’Ollama et ne fonctionne donc pas intégralement sur votre machine.

Ollama indique appliquer une politique de conservation nulle des données pour son service cloud, mais si votre objectif est de ne transmettre aucune donnée sur Internet, choisissez simplement un modèle local.

Ollama est-il gratuit ?

L’utilisation locale d’Ollama et des modèles gratuits compatibles ne nécessite pas d’abonnement ni de paiement par requête.

Ollama propose cependant désormais des services cloud et des offres payantes facultatives pour accéder à de très grands modèles exécutés sur ses infrastructures.

Il ne faut donc plus présenter Ollama comme un service exclusivement local : le logiciel permet aujourd’hui de combiner modèles locaux et cloud.

Ollama ou LM Studio ?

Ollama LM Studio
Interface graphique Oui sur Windows et macOS Oui
CLI Très complète Oui
API locale Oui Oui
Automatisation Très adaptée Possible
Débutants Simple Très simple
Agents de code Intégrations très poussées Possible selon les outils

LM Studio reste excellent pour découvrir les modèles locaux dans une interface très visuelle. Ollama se distingue davantage lorsqu’on souhaite automatiser des tâches, utiliser une API ou connecter un modèle à des outils de développement.

Découvrez également notre guide pour installer Mistral AI en local avec LM Studio.

FAQ : installer et utiliser Ollama

Ollama fonctionne-t-il sans Internet ?

Oui. Une fois le modèle téléchargé, un modèle local peut fonctionner sans connexion Internet.

Ollama fonctionne-t-il sans carte graphique ?

Oui. L’exécution sur CPU est possible, mais elle est généralement beaucoup plus lente. Des modèles légers comme Phi-4 Mini sont particulièrement adaptés à ce type de configuration.

Combien de RAM faut-il pour Ollama ?

8 Go permettent de tester de petits modèles. 16 Go constituent un bon minimum pour une utilisation sérieuse, tandis que 32 Go permettent d’utiliser beaucoup plus confortablement des modèles de 20 à 30 milliards de paramètres.

Quel modèle essayer avec 16 Go de RAM ?

Gemma 4 12B ou Qwen 3.5 9B sont de bons choix. gpt-oss 20B peut également fonctionner avec 16 Go selon OpenAI, mais laisse moins de marge au système et aux longs contextes.

Quel modèle utiliser pour programmer ?

Qwen3-Coder 30B constitue une option intéressante si la machine dispose de suffisamment de mémoire. gpt-oss 20B peut aussi être utilisé avec des agents de programmation.

Ollama dispose-t-il d’une interface graphique ?

Oui. L’application Ollama pour Windows et macOS permet désormais de télécharger des modèles, discuter avec eux et joindre certains fichiers directement depuis une interface graphique.

Sources

techpi avatar Albert
Albert

Journaliste tech depuis 2013, je suis Albert et je décrypte l'actualité high-tech pour la rendre claire et utile au quotidien. Spécialisé dans le hardware, les objets connectés et le gaming, je teste également les logiciels et les outils d'intelligence artificielle qui changent nos usages. Aussi fasciné par l'écosystème Apple que par les configurations PC les plus underground. Passé par plusieurs rédactions de référence comme MacPlus et Phonandroid, je mets cette expérience au service de tests transparents, impartiaux et ancrés dans un usage 100 % réel.
Contactez : contact@techpi.fr

Articles: 713