Ollama permet d’installer et d’utiliser une intelligence artificielle directement sur son PC ou son Mac, sans envoyer obligatoirement ses données vers un service cloud. En 2026, l’outil ne se limite plus au terminal : Ollama propose désormais une application graphique sur Windows et macOS, prend en charge les modèles multimodaux, peut servir d’API locale et se connecter à des outils comme Claude Code, Codex ou Open WebUI. Voici comment installer Ollama, choisir le bon modèle et lancer une IA locale sur Windows, macOS ou Linux.
Dernière mise à jour : 27 septembre 2026.
Pour choisir votre matériel, consultez également notre guide quel PC choisir pour une IA locale en 2026 et notre comparatif 16, 32 ou 64 Go de RAM pour l’IA locale.
Ce qu’il faut retenir
- Ollama fonctionne sur Windows, macOS et Linux.
- Une interface graphique est intégrée sur macOS et Windows.
- Les modèles peuvent fonctionner entièrement en local et hors ligne.
- Ollama expose une API locale sur le port 11434.
- Les API compatibles OpenAI et Anthropic facilitent l’intégration dans d’autres applications.
- gpt-oss:20b est un bon modèle généraliste pour une machine suffisamment équipée.
- Gemma 4 et Muse Glimmer permettent également d’analyser des images.
- Ollama propose désormais aussi des modèles cloud, mais leur utilisation reste facultative.
Qu’est-ce qu’Ollama ?
Ollama est un outil permettant de télécharger et d’exécuter des modèles d’intelligence artificielle sur son propre ordinateur.
Une fois un modèle installé, les calculs peuvent être effectués directement par votre CPU, votre GPU ou la mémoire unifiée d’un Mac Apple Silicon.
Ollama peut être utilisé de plusieurs façons :
- avec son application graphique ;
- depuis le Terminal ou PowerShell ;
- comme serveur API local ;
- avec Open WebUI ;
- dans des applications Python ou JavaScript ;
- avec des agents de programmation comme Claude Code, Codex ou OpenCode.
Ollama propose également un service cloud facultatif pour exécuter des modèles beaucoup trop volumineux pour un ordinateur personnel. Ce guide se concentre principalement sur l’utilisation locale.
Quelle configuration faut-il pour Ollama ?
Ollama lui-même est relativement léger. C’est surtout le modèle choisi qui détermine la quantité de mémoire nécessaire.
| Mémoire disponible | Modèles adaptés | Usage |
|---|---|---|
| 8 Go | Phi-4 Mini, Qwen 3.5 4B | Chat léger, tests, petites tâches |
| 16 Go | Qwen 3.5 9B, Gemma 4 12B, gpt-oss 20B avec peu de marge | Usage général |
| 24 à 32 Go | gpt-oss 20B, Qwen3-Coder 30B, Muse Glimmer 30B | Raisonnement, multimodal, code |
| 64 Go et plus | Modèles 30B à 70B et plus | Workstation et gros modèles locaux |
Ces chiffres sont des repères. La quantité réellement nécessaire dépend de la quantification, de la fenêtre de contexte et de la mémoire utilisée par le système.
Par exemple, gpt-oss:20b représente environ 14 Go dans Ollama. OpenAI indique que ce modèle peut fonctionner avec 16 Go de mémoire, mais une machine de 24 ou 32 Go laisse évidemment davantage de marge pour le système et le contexte.
Installer Ollama sur Windows
Ollama nécessite actuellement Windows 10 ou une version plus récente.
La méthode la plus simple consiste à télécharger l’application depuis :
Télécharger Ollama pour Windows
Il est également possible de l’installer directement depuis PowerShell :
irm https://ollama.com/install.ps1 | iex
Une fois l’installation terminée, ouvrez PowerShell et vérifiez qu’Ollama répond :
ollama --version
Installer Ollama sur macOS
Sur Mac, téléchargez l’application depuis le site officiel puis placez-la dans le dossier Applications.
Sur les Mac Apple Silicon, Ollama bénéficie désormais d’un moteur basé sur MLX, le framework d’apprentissage automatique développé par Apple.
Cette architecture exploite directement la mémoire unifiée des puces Apple Silicon et améliore fortement les performances de certains modèles optimisés.
Vous pouvez vérifier l’installation dans le Terminal :
ollama --version
Pour certains modèles optimisés MLX, Ollama propose désormais des variantes dédiées. Par exemple :
ollama run muse-glimmer:30b-mlx
Installer Ollama sur Linux
Sur Linux, ouvrez un terminal et utilisez le script officiel :
curl -fsSL https://ollama.com/install.sh | sh
Vérifiez ensuite l’installation :
ollama --version
Ollama prend en charge l’accélération GPU sur de nombreux matériels NVIDIA et AMD. Depuis Ollama 0.30, Vulkan est également activé par défaut, ce qui élargit la compatibilité avec certains GPU AMD et Intel.
L’application Ollama permet désormais d’éviter le terminal
C’est l’une des principales évolutions par rapport aux anciennes versions d’Ollama.
Sur Windows et macOS, l’application permet désormais de télécharger un modèle puis de discuter directement avec lui sans utiliser de ligne de commande.
Il est également possible de glisser-déposer certains fichiers dans une conversation, notamment :
- des fichiers texte ;
- des documents PDF ;
- du code ;
- des images lorsque le modèle est multimodal.
Le terminal reste néanmoins particulièrement pratique pour automatiser Ollama ou l’intégrer à d’autres logiciels.
Télécharger et lancer son premier modèle
La commande principale est extrêmement simple :
ollama run nom-du-modele
Par exemple, pour lancer le modèle open-weight d’OpenAI :
ollama run gpt-oss:20b
Lors du premier lancement, Ollama télécharge automatiquement les fichiers nécessaires. Les lancements suivants utilisent la copie stockée localement.
Pour une machine moins puissante, vous pouvez essayer :
ollama run phi4-mini
ou :
ollama run qwen3.5:4b
Quels modèles Ollama choisir en septembre 2026 ?
| Modèle | Taille Ollama approximative | Usage conseillé |
|---|---|---|
| Phi-4 Mini | 2,5 Go | Petit modèle rapide |
| Qwen 3.5 9B | 6,6 Go | Usage général et multimodal |
| Gemma 4 12B | 7,6 Go | Texte, images et raisonnement |
| gpt-oss 20B | 14 Go | Raisonnement et outils |
| Qwen3-Coder 30B | 19 Go | Programmation et agents de code |
| Muse Glimmer 30B | 18 Go environ | Agents, outils et analyse d’images |
Pour un utilisateur disposant de 16 à 32 Go de mémoire, gpt-oss 20B, Gemma 4 12B et Qwen 3.5 constituent d’excellents points de départ selon les usages.
Les commandes Ollama à connaître
Afficher les modèles installés :
ollama list
Voir les modèles actuellement chargés en mémoire :
ollama ps
Afficher les informations d’un modèle :
ollama show gpt-oss:20b
Télécharger un modèle sans le lancer :
ollama pull gpt-oss:20b
Supprimer un modèle :
ollama rm gpt-oss:20b
Utiliser Ollama comme API locale
Ollama expose par défaut son API sur :
http://localhost:11434
Pour démarrer manuellement le serveur :
ollama serve
Exemple avec l’API native Ollama
curl http://localhost:11434/api/chat \
-d '{
"model": "gpt-oss:20b",
"messages": [
{
"role": "user",
"content": "Explique simplement ce qu’est un réseau neuronal."
}
],
"stream": false
}'
Utiliser l’API compatible OpenAI
Ollama propose également une API compatible avec le format utilisé par de nombreuses applications OpenAI.
L’adresse devient :
http://localhost:11434/v1
Exemple :
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss:20b",
"messages": [
{
"role": "user",
"content": "Pourquoi le ciel est-il bleu ?"
}
]
}'
Cette compatibilité permet d’utiliser de nombreux logiciels prévus à l’origine pour l’API OpenAI en changeant simplement l’adresse du serveur.
Utiliser Ollama avec Claude Desktop et les agents de code
Ollama est devenu beaucoup plus intéressant pour les développeurs en 2026.
La commande ollama launch permet de configurer automatiquement plusieurs outils de programmation pour utiliser un modèle local ou cloud.
Par exemple :
ollama launch claude --model gpt-oss:20b
Pour OpenCode :
ollama launch opencode --model qwen3-coder:30b
Ollama peut également fonctionner avec Codex et plusieurs autres outils d’agents de programmation.
Depuis août 2026, Claude Desktop peut lui aussi utiliser Ollama comme fournisseur tiers. L’intégration peut être activée directement depuis les réglages de l’application Ollama.
Ajouter Open WebUI
L’application officielle d’Ollama suffit désormais pour la plupart des usages simples.
Open WebUI reste néanmoins intéressant pour créer une interface web plus complète, gérer plusieurs utilisateurs, organiser des conversations ou utiliser Ollama depuis un navigateur.
Si Open WebUI fonctionne dans Docker, il peut généralement accéder à Ollama via :
http://host.docker.internal:11434
Pour un usage strictement personnel sur Windows ou Mac, il n’est cependant plus indispensable d’installer Open WebUI simplement pour obtenir une interface graphique.
Comment améliorer les performances d’Ollama ?
Le facteur principal reste la quantité de mémoire disponible.
Un modèle entièrement chargé dans la VRAM du GPU sera généralement beaucoup plus rapide qu’un modèle réparti entre GPU et RAM système.
Quelques principes restent utiles :
- utiliser un modèle adapté à la quantité de RAM ou VRAM disponible ;
- éviter des fenêtres de contexte énormes lorsque ce n’est pas nécessaire ;
- maintenir les pilotes graphiques à jour ;
- privilégier les variantes MLX sur les Mac Apple Silicon lorsqu’elles sont disponibles ;
- utiliser un modèle plus petit plutôt qu’un énorme modèle qui fonctionne principalement sur CPU.
Depuis 2026, Ollama bénéficie également d’importantes optimisations NVIDIA et de Vulkan pour davantage de GPU AMD et Intel.
Les données restent-elles vraiment privées ?
Oui, lorsque vous utilisez un modèle entièrement local.
Dans ce cas, le modèle et son exécution restent sur votre ordinateur. Une connexion Internet n’est plus nécessaire une fois le modèle téléchargé.
Il faut toutefois distinguer cette utilisation des nouveaux modèles cloud Ollama.
Un modèle dont le nom comporte par exemple :cloud utilise les serveurs d’Ollama et ne fonctionne donc pas intégralement sur votre machine.
Ollama indique appliquer une politique de conservation nulle des données pour son service cloud, mais si votre objectif est de ne transmettre aucune donnée sur Internet, choisissez simplement un modèle local.
Ollama est-il gratuit ?
L’utilisation locale d’Ollama et des modèles gratuits compatibles ne nécessite pas d’abonnement ni de paiement par requête.
Ollama propose cependant désormais des services cloud et des offres payantes facultatives pour accéder à de très grands modèles exécutés sur ses infrastructures.
Il ne faut donc plus présenter Ollama comme un service exclusivement local : le logiciel permet aujourd’hui de combiner modèles locaux et cloud.
Ollama ou LM Studio ?
| Ollama | LM Studio | |
|---|---|---|
| Interface graphique | Oui sur Windows et macOS | Oui |
| CLI | Très complète | Oui |
| API locale | Oui | Oui |
| Automatisation | Très adaptée | Possible |
| Débutants | Simple | Très simple |
| Agents de code | Intégrations très poussées | Possible selon les outils |
LM Studio reste excellent pour découvrir les modèles locaux dans une interface très visuelle. Ollama se distingue davantage lorsqu’on souhaite automatiser des tâches, utiliser une API ou connecter un modèle à des outils de développement.
Découvrez également notre guide pour installer Mistral AI en local avec LM Studio.
FAQ : installer et utiliser Ollama
Ollama fonctionne-t-il sans Internet ?
Oui. Une fois le modèle téléchargé, un modèle local peut fonctionner sans connexion Internet.
Ollama fonctionne-t-il sans carte graphique ?
Oui. L’exécution sur CPU est possible, mais elle est généralement beaucoup plus lente. Des modèles légers comme Phi-4 Mini sont particulièrement adaptés à ce type de configuration.
Combien de RAM faut-il pour Ollama ?
8 Go permettent de tester de petits modèles. 16 Go constituent un bon minimum pour une utilisation sérieuse, tandis que 32 Go permettent d’utiliser beaucoup plus confortablement des modèles de 20 à 30 milliards de paramètres.
Quel modèle essayer avec 16 Go de RAM ?
Gemma 4 12B ou Qwen 3.5 9B sont de bons choix. gpt-oss 20B peut également fonctionner avec 16 Go selon OpenAI, mais laisse moins de marge au système et aux longs contextes.
Quel modèle utiliser pour programmer ?
Qwen3-Coder 30B constitue une option intéressante si la machine dispose de suffisamment de mémoire. gpt-oss 20B peut aussi être utilisé avec des agents de programmation.
Ollama dispose-t-il d’une interface graphique ?
Oui. L’application Ollama pour Windows et macOS permet désormais de télécharger des modèles, discuter avec eux et joindre certains fichiers directement depuis une interface graphique.
Sources
- Ollama — téléchargement officiel pour Windows, macOS et Linux
- Ollama — nouvelle application graphique pour Windows et macOS
- Ollama — moteur MLX sur Apple Silicon
- Ollama — performances GPU et prise en charge Vulkan
- Ollama — modèles OpenAI gpt-oss
- OpenAI — présentation de gpt-oss 20B et 120B
- Ollama — Qwen3-Coder
- Ollama — Gemma 4
- Ollama — Muse Glimmer
- Ollama — commande ollama launch et intégrations de code
- Ollama — intégration avec Claude Desktop








