Qwen3.8-27B pourrait bien devenir l’un des modèles d’IA locale les plus intéressants de 2026. Alibaba propose ici un modèle dense de 27 milliards de paramètres capable de traiter du texte et des images, de raisonner, de coder et d’utiliser des outils, avec une fenêtre de contexte native de 262 144 tokens. Surtout, des versions quantifiées permettent de le faire tourner sur un PC ou un Mac grand public haut de gamme : comptez environ 18 Go pour une bonne version Q4. Voici comment installer Qwen3.8-27B en local avec Ollama, LM Studio, Unsloth ou llama.cpp, et surtout quelle configuration choisir.
Dernière mise à jour : 16 août 2026.
Ce qu’il faut retenir
- Qwen3.8-27B possède 27 milliards de paramètres et utilise une architecture dense.
- Le modèle est multimodal : il comprend le texte, les images et la vidéo.
- Sa fenêtre de contexte native atteint 262 144 tokens.
- Qwen annonce une extension possible jusqu’à environ un million de tokens, mais cette longueur demande énormément de mémoire en local.
- Le modèle dispose d’un mode de raisonnement activé par défaut, avec plusieurs niveaux d’effort.
- Les poids officiels sont publiés sous licence Apache 2.0.
- La version GGUF Unsloth UD-Q4_K_XL pèse environ 17,9 Go.
- Ollama propose directement qwen3.8:27b, autour de 18 Go.
- Une carte avec 24 Go de VRAM constitue aujourd’hui l’un des meilleurs choix pour l’exécuter confortablement.
- Avec 16 Go de VRAM, il reste utilisable avec une quantification plus légère ou un déchargement partiel vers la RAM.
Si vous découvrez seulement l’IA locale, commencez par notre guide complet pour installer une IA en local sur PC ou Mac. Nous y expliquons notamment la différence entre RAM, VRAM, quantification, LM Studio et Ollama.
Qwen3.8-27B, c’est quoi exactement ?
Qwen3.8-27B appartient à la nouvelle génération de modèles ouverts développés par l’équipe Qwen d’Alibaba.
Il s’agit d’un modèle dense de 27 milliards de paramètres. Contrairement à une architecture Mixture of Experts dans laquelle seule une partie des paramètres est activée pour chaque token, l’intégralité du modèle participe ici au calcul.
Alibaba présente Qwen3.8 comme une évolution particulièrement importante pour le code, le travail professionnel, la recherche et les tâches agentiques de longue durée. Le modèle est également conçu pour mieux gérer les retours d’un environnement lorsqu’il agit comme agent et doit enchainer plusieurs actions.
| Qwen3.8-27B | Caractéristiques |
|---|---|
| Paramètres | 27 milliards |
| Architecture | Dense |
| Entrées | Texte, images, vidéo |
| Contexte natif | 262 144 tokens |
| Contexte étendu | Jusqu’à environ 1 million de tokens |
| Raisonnement | Oui, réglable et désactivable |
| MTP | Oui |
| Licence | Apache 2.0 |
| Taille d’un bon GGUF Q4 | Environ 17,9 Go |
La fiche officielle confirme également un encodeur visuel natif. Qwen3.8-27B n’est donc pas seulement un chatbot textuel : il peut recevoir une image, analyser un document visuel ou travailler sur des contenus vidéo lorsque le moteur d’inférence utilisé prend correctement ces fonctions en charge.
Pourquoi Qwen3.8-27B est particulièrement intéressant en local
Le principal problème des modèles les plus performants est généralement leur taille.
Un modèle de plusieurs centaines de milliards de paramètres peut produire d’excellents résultats mais nécessite des serveurs dont le coût dépasse largement celui d’un PC personnel.
Avec ses 27 milliards de paramètres, Qwen3.8-27B vise un compromis beaucoup plus intéressant.
Il reste suffisamment gros pour réaliser des tâches complexes, mais suffisamment compact pour être compressé autour de 18 Go en Q4.
C’est précisément la catégorie de modèles qui devient exploitable sur des cartes graphiques disposant de 20 à 24 Go de VRAM, ou sur un Mac Apple Silicon doté d’une quantité suffisante de mémoire unifiée.
Pour comprendre pourquoi la VRAM compte davantage que la puissance gaming brute, consultez notre dossier quel GPU choisir pour un LLM en local en 2026.
Quelle quantité de RAM ou de VRAM faut-il pour Qwen3.8-27B ?
La réponse dépend énormément de la quantification utilisée.
Les poids BF16 du modèle occupent autour de 55 Go. L’intérêt du format GGUF est précisément de réduire considérablement cette taille afin de rendre le modèle accessible à un PC domestique.
Unsloth propose plusieurs quantifications dont les tailles varient fortement. La version UD-Q4_K_XL atteint environ 17,9 Go, tandis que UD-Q3_K_XL descend autour de 13,4 Go. Une quantification UD-IQ2_XXS particulièrement agressive tombe autour de 9 Go, au prix d’une perte de précision plus importante.
| Configuration | Qwen3.8-27B | Notre conseil |
|---|---|---|
| 16 Go de RAM sans GPU puissant | Très difficile | Choisir plutôt un modèle plus petit |
| 16 Go de VRAM + 32 Go de RAM | Oui | Q3 ou Q4 avec déchargement vers la RAM |
| 24 Go de VRAM | Très adapté | Q4 recommandé |
| 32 Go de VRAM | Excellent | Q4/Q5 et davantage de contexte |
| Mac 24 Go de mémoire unifiée | Possible mais serré | Réduire le contexte et fermer les applications lourdes |
| Mac 32 Go | Bien adapté | Q4 avec marge plus confortable |
| Mac 64 Go ou plus | Excellent | Quantifications supérieures et grand contexte |
Unsloth indique que Qwen3.8-27B peut descendre jusqu’à environ 17 Go de mémoire totale avec ses GGUF dynamiques. Cette valeur doit toutefois être comprise comme un minimum technique et non comme la configuration idéale d’un PC quotidien.
Attention au cas de la GeForce RTX 5080
Une confusion apparaît dans certains guides : la GeForce RTX 5080 possède 16 Go de VRAM. Elle ne peut donc pas accueillir intégralement un fichier Q4 de 17 à 18 Go dans sa seule mémoire vidéo.
Le modèle fonctionnera néanmoins si le logiciel place certaines couches dans la RAM du PC, ou en choisissant une quantification Q3 plus compacte.
Le résultat sera généralement moins rapide qu’avec une RTX 3090, RTX 4090 ou autre GPU offrant 24 Go ou davantage de VRAM.
Ce cas illustre pourquoi la mémoire disponible est si importante pour l’IA locale. Notre guide 16, 32 ou 64 Go de RAM pour l’IA en 2026 détaille également les besoins selon la taille des modèles.
RTX 3090 et RTX 4090 : toujours excellentes pour Qwen3.8-27B
Qwen3.8-27B donne aussi une nouvelle raison de s’intéresser aux GPU NVIDIA disposant de 24 Go de mémoire.
Une RTX 3090 ou une RTX 4090 dispose d’assez de VRAM pour accueillir une version Q4 du modèle tout en conservant une certaine marge pour le cache KV et les autres données nécessaires à l’inférence.
Une RTX 5090 avec 32 Go offre naturellement encore davantage de marge, notamment lorsque le contexte augmente.
Pour monter une machine spécialement destinée à cet usage, retrouvez également notre configuration PC complète pour faire tourner une IA en local.
Le contexte de 256K est-il réellement utilisable sur un PC ?
Oui techniquement, mais il ne faut pas confondre capacité maximale et utilisation confortable.
Alibaba annonce une fenêtre native de 262 144 tokens. vLLM permet même d’étendre Qwen3.8-27B autour d’un million de tokens à l’aide des réglages appropriés.
Mais plus la conversation s’allonge, plus le cache KV consomme de mémoire.
Sur une machine dotée de 24 Go, vouloir systématiquement utiliser 256K de contexte peut donc supprimer toute la marge disponible et provoquer du déchargement vers la RAM ou une erreur de mémoire.
Pour un usage local classique, 8K, 16K ou 32K constituent déjà des fenêtres très généreuses. Augmentez ensuite progressivement en fonction de votre matériel et de vos besoins.
Le million de tokens doit surtout être considéré comme une capacité destinée aux stations de travail et aux serveurs disposant de beaucoup plus de mémoire.
Qwen3.8-27B peut réfléchir avant de répondre
Qwen3.8 adopte un fonctionnement hybride intéressant.
Par défaut, le modèle utilise un mode de raisonnement et produit une phase de réflexion avant sa réponse finale. Alibaba permet cependant de désactiver ce comportement lorsqu’une réponse immédiate est préférable.
Trois niveaux principaux de reasoning_effort sont disponibles :
- xhigh : niveau par défaut, pour les problèmes complexes ;
- medium : compromis entre vitesse et profondeur ;
- low : réponses plus rapides et raisonnement plus court.
Il existe également un mécanisme baptisé preserve_thinking. Celui-ci permet de conserver le contexte de raisonnement des échanges précédents pour éviter de repartir de zéro à chaque étape d’une tâche agentique.
Comment installer Qwen3.8-27B avec Ollama
Ollama constitue probablement la méthode la plus rapide pour tester le modèle.
La bibliothèque officielle référence déjà Qwen3.8-27B avec vision, outils et raisonnement. La version principale représente environ 18 Go.
Après avoir installé Ollama, ouvrez PowerShell, Windows Terminal ou un terminal macOS/Linux et tapez :
ollama run qwen3.8:27b
Ollama télécharge automatiquement le modèle lors du premier lancement.
Pour le télécharger sans immédiatement ouvrir une conversation :
ollama pull qwen3.8:27b
Puis pour vérifier qu’il est installé :
ollama ls
Si vous n’avez jamais utilisé cet outil, consultez notre guide complet pour installer et utiliser Ollama sur Windows, macOS et Linux.
Nous proposons également un tutoriel plus direct consacré à Ollama sur Windows.
Installer Qwen3.8-27B avec LM Studio
LM Studio reste plus accessible pour un utilisateur qui ne souhaite pas utiliser le terminal.
La fiche officielle de Qwen renvoie directement vers les quantifications compatibles avec llama.cpp, Ollama et LM Studio.
La méthode est simple :
- ouvrez LM Studio ;
- ouvrez le catalogue de modèles ;
- recherchez Qwen3.8-27B ;
- privilégiez une version GGUF provenant d’une source reconnue, comme Unsloth ;
- choisissez la quantification correspondant à votre mémoire ;
- chargez le modèle puis réduisez le contexte si LM Studio indique que la mémoire disponible est insuffisante.
Pour une carte de 24 Go ou un Mac suffisamment équipé, Q4 constitue le point de départ que nous recommandons.
Avec 16 Go de VRAM, une version Q3 est plus facile à conserver entièrement sur le GPU. Une Q4 reste possible en utilisant la RAM, mais sera moins optimale.
Notre tutoriel installer LM Studio sur Windows et lancer une IA locale détaille toutes les étapes de l’installation et du chargement d’un modèle GGUF.
Installer le GGUF Unsloth avec Ollama
Il est également possible d’utiliser directement les quantifications Unsloth depuis Hugging Face.
La documentation du dépôt propose par exemple :
ollama run hf.co/unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL
Cette version UD-Q4_K_XL pèse environ 17,9 Go.
Cette solution est intéressante pour les utilisateurs souhaitant contrôler précisément la quantification utilisée plutôt que de récupérer automatiquement la variante standard de la bibliothèque Ollama.
Installer Qwen3.8-27B avec llama.cpp
Les utilisateurs avancés peuvent également exécuter directement les GGUF avec llama.cpp.
Après compilation ou installation de llama.cpp, le fichier Q4 peut par exemple être lancé avec une commande de ce type :
./llama-cli \
--model Qwen3.8-27B-UD-Q4_K_XL.gguf \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0
Les réglages correspondent aux recommandations actuelles pour le mode de raisonnement du modèle. La documentation fournie avec les quantifications Unsloth recommande notamment une température de 1,0, un top_p de 0,95 et un top_k de 20 pour ce mode.
Quelle quantification choisir ?
| Quantification | Taille approximative | À choisir si… |
|---|---|---|
| UD-IQ2_XXS | 9 Go | La mémoire est vraiment limitée |
| UD-Q3_K_XL | 13,4 Go | Vous disposez de 16 Go de VRAM |
| UD-Q4_K_XL | 17,9 Go | Meilleur compromis général |
| UD-Q5_K_XL | 20,2 Go | Vous avez au moins 24 à 32 Go disponibles |
| UD-Q6_K_XL | 25,9 Go | Vous privilégiez davantage la qualité |
| UD-Q8_K_XL | 31,5 Go | Vous disposez d’une grosse station de travail |
Ces tailles proviennent des fichiers GGUF actuellement publiés par Unsloth sur Hugging Face.
Notre choix pour la majorité des utilisateurs reste Q4. Descendre vers Q2 permet de gagner énormément de mémoire, mais la compression commence à devenir suffisamment agressive pour affecter davantage le comportement du modèle.
Qwen3.8-27B est également capable d’analyser des images
L’un de ses principaux avantages face à de nombreux LLM locaux reste sa nature multimodale native.
Alibaba annonce la compréhension d’images et de vidéos, notamment pour l’analyse de documents, de diagrammes scientifiques ou de contenus visuels complexes.
Dans Ollama, le paquet Qwen3.8 comprend d’ailleurs un projecteur visuel supplémentaire d’environ 931 Mo.
Cette fonction permet par exemple de demander au modèle :
- d’expliquer une capture d’écran ;
- d’analyser un graphique ;
- de lire un document photographié ;
- d’identifier un problème dans une interface ;
- de commenter une image associée à une question.
La disponibilité exacte des fonctions multimodales dépend néanmoins du logiciel utilisé et de sa prise en charge du modèle.
Qwen3.8-27B est-il vraiment meilleur que Qwen3.6-27B ?
D’après les évaluations publiées par Alibaba, la progression est substantielle.
| Benchmark publié par Qwen | Qwen3.6-27B | Qwen3.8-27B |
|---|---|---|
| Terminal Bench 2.1 | 63,4 | 73,0 |
| SWE-bench Pro | 53,5 | 61,7 |
| DeepSWE 1.1 | 13,3 | 42,2 |
| CoWorkBench | 61,0 | 70,7 |
| GPQA Diamond | 87,8 | 89,2 |
| OSWorld-Verified | 63,9 | 84,3 |
Ces résultats proviennent directement de la fiche officielle Qwen et doivent donc être considérés comme des benchmarks publiés par le constructeur, pas comme notre propre test indépendant.
Ils indiquent néanmoins clairement où Alibaba concentre ses efforts : le code agentique, l’utilisation d’un ordinateur et les tâches comportant de nombreuses étapes.
Le MTP peut accélérer la génération
Qwen3.8-27B a également été entraîné avec Multi-Token Prediction, ou MTP.
L’idée consiste à permettre au moteur d’inférence de prédire plusieurs tokens futurs afin d’accélérer la génération lorsqu’une partie de ces prédictions peut être acceptée.
vLLM documente officiellement son activation sur Qwen3.8 via le décodage spéculatif.
Le gain réel dépend cependant énormément du GPU, du moteur d’inférence, de la quantification et du type de génération. Les implémentations locales viennent tout juste d’arriver : il vaut donc mieux éviter de considérer un chiffre de vitesse particulier comme garanti sur toutes les configurations.
Qwen3.8-27B fonctionne-t-il réellement hors ligne ?
Oui.
Après avoir téléchargé les poids et le moteur d’inférence, les opérations de génération peuvent rester entièrement sur le PC ou le Mac.
C’est l’un des principaux intérêts d’un modèle de cette catégorie : traiter des documents, du code ou des informations internes sans envoyer systématiquement chaque prompt vers les serveurs d’OpenAI, Google, Anthropic ou Alibaba.
Attention toutefois aux extensions et outils ajoutés autour du modèle. Une fonction de recherche web, un serveur MCP ou un service distant peut naturellement transmettre des informations sur Internet même si le LLM lui-même fonctionne localement.
Notre guide général de l’IA locale explique comment vérifier simplement qu’un modèle fonctionne bien après avoir coupé la connexion Internet.
Qwen3.8-27B est-il gratuit ?
Les poids officiels de Qwen3.8-27B sont publiés sur Hugging Face sous licence Apache 2.0.
Il est donc possible de télécharger et d’exécuter le modèle sans abonnement à Qwen Cloud.
L’utilisation locale n’est évidemment pas totalement gratuite au sens économique : elle consomme de l’électricité et nécessite une machine suffisamment puissante. Mais il n’existe pas de facturation par token lorsque vous exécutez vos propres poids sur votre matériel.
Qwen3.8-27B ou un modèle plus petit ?
Il ne faut pas installer Qwen3.8-27B simplement parce qu’il est récent.
Une machine disposant de 16 Go de RAM et d’un GPU de 8 Go aura une bien meilleure expérience avec un modèle de 4B, 8B ou 9B correctement dimensionné.
Qwen3.8-27B devient véritablement intéressant à partir des configurations disposant d’une quantité importante de mémoire.
| Votre machine | Notre recommandation |
|---|---|
| 8 à 16 Go de RAM | Choisir un petit modèle local |
| GPU 8 à 12 Go | Viser 4B à 14B selon la quantification |
| GPU 16 Go | Qwen3.8-27B Q3 possible |
| GPU 24 Go | Qwen3.8-27B Q4 recommandé |
| GPU 32 Go ou plus | Qwen3.8-27B avec quantification et contexte supérieurs |
| Mac 32 à 64 Go | Très bon candidat |
Pour comparer Qwen aux autres alternatives actuelles, consultez notre comparatif des meilleurs modèles d’IA à installer en local en 2026.
Faut-il installer Qwen3.8-27B en local ?
Oui, si votre machine dispose d’au moins 24 à 32 Go de mémoire exploitable confortablement et que vous recherchez un modèle local avancé.
Qwen3.8-27B combine plusieurs qualités rarement réunies à cette taille : 27 milliards de paramètres denses, vision, raisonnement réglable, outils, capacités agentiques, contexte extrêmement long et licence permissive.
Sa version Q4 autour de 18 Go le place surtout dans une zone particulièrement intéressante : trop grosse pour les petits PC, mais parfaitement réaliste pour une station de travail personnelle équipée d’une carte 24 Go ou un Mac Apple Silicon disposant de suffisamment de mémoire unifiée.
Pour une utilisation principalement tournée vers le chat, la rédaction ou les résumés simples, un modèle plus petit restera souvent plus rapide et suffisant.
En revanche, pour le code, l’analyse de documents, la vision, le raisonnement et la construction d’un assistant local plus autonome, Qwen3.8-27B fait désormais partie des modèles à tester en priorité.
Nos guides TechPi pour aller plus loin avec l’IA locale
- Comment installer une IA en local sur PC et Mac en 2026
- Meilleurs modèles IA en local en 2026 : notre comparatif
- Installer LM Studio sur Windows : le guide pas à pas
- Installer et utiliser Ollama sur Windows, Mac et Linux
- Ollama sur Windows : lancer facilement une IA locale
- Quel GPU choisir pour un LLM en local en 2026 ?
- 16, 32 ou 64 Go de RAM pour un PC IA ?
- Quel PC choisir pour faire tourner une IA en local ?
- La meilleure configuration PC pour une IA locale








