Logo NVIDIA avec représentation du modèle Nemotron 3.5 Lightning de 30 milliards de paramètres

NVIDIA lance Nemotron 3.5 Lightning et prépare Nemotron 4

NVIDIA a publié Nemotron 3.5 Lightning, un modèle ouvert de 30 milliards de paramètres dont trois milliards sont actifs à chaque étape. Conçu pour exécuter rapidement les tâches répétitives des agents IA, il peut fonctionner localement sur du matériel haut de gamme. En parallèle, NVIDIA développe bien Nemotron 4, mais son éventuelle version à mille milliards de paramètres et son calendrier restent des informations rapportées, non confirmées dans le détail par l’entreprise.

L’annonce illustre une stratégie à deux niveaux. Nemotron 3.5 Lightning vise l’efficacité immédiate : appels d’outils, vérification de résultats, formatage et sous-tâches. Nemotron 4 chercherait au contraire à fournir une nouvelle famille de modèles de pointe capables de rivaliser avec les meilleures solutions à poids ouverts.

Ce qu’il faut retenir

  • Nemotron 3.5 Lightning est officiellement disponible depuis le 11 août 2026.
  • Il totalise 30 milliards de paramètres, mais n’en active que 3 milliards par jeton grâce à son architecture Mixture-of-Experts.
  • NVIDIA publie les poids, des données et des recettes d’entraînement sous licence OpenMDW 1.1.
  • Le modèle accepte jusqu’à un million de jetons de contexte selon sa fiche technique.
  • Nemotron 4 est bien en développement, mais le modèle d’au moins mille milliards de paramètres provient d’un reportage de The Information relayé par Reuters.
  • Aucune date de sortie officielle de Nemotron 4 n’est fixée.

Nemotron 3.5 Lightning : un modèle ouvert de 30B

Nemotron 3.5 Lightning utilise une architecture hybride associant Mamba-2, attention et Mixture-of-Experts. Les 30 milliards de paramètres forment la capacité totale du modèle, mais seuls trois milliards sont activés pour traiter un jeton. Cette organisation réduit le coût de calcul par rapport à un modèle dense de taille comparable.

Le terme « Lightning » décrit son rôle : exécuter beaucoup d’actions avec une faible latence. NVIDIA le destine aux agents autonomes qui passent une grande partie de leur temps à appeler des outils, vérifier des réponses, lire des résultats et déléguer des sous-tâches. Un modèle de raisonnement plus lourd peut établir le plan, puis Lightning réalise les opérations courantes.

Caractéristique Nemotron 3.5 Lightning
Paramètres totaux 30 milliards
Paramètres actifs 3 milliards
Architecture MoE hybride Mamba-2 et attention
Contexte maximal annoncé Jusqu’à 1 million de jetons
Formats publiés BF16 et NVFP4
Licence OpenMDW 1.1
Langues annoncées Anglais, français, espagnol, allemand, italien, japonais et langages de programmation

Peut-il vraiment fonctionner sur une seule carte graphique ?

NVIDIA cite explicitement la GeForce RTX 5090, Jetson et DGX Spark parmi les plateformes locales possibles. La version NVFP4 réduit fortement l’empreinte mémoire par rapport au BF16. Cela rend le déploiement local crédible sur une machine très haut de gamme, mais « fonctionner » ne signifie pas nécessairement offrir les mêmes performances ou le même débit sur tous les PC.

La mémoire vidéo disponible, le moteur d’inférence, la longueur du contexte et le nombre de requêtes simultanées changent radicalement l’expérience. Un contexte maximal d’un million de jetons peut réclamer beaucoup plus de mémoire que des conversations courtes. Les utilisateurs d’une carte grand public moins puissante devront probablement employer une quantification plus agressive, réduire le contexte ou accepter une vitesse inférieure.

Des performances prometteuses, mais à lire avec prudence

NVIDIA affirme que son modèle fournit jusqu’à quatre fois le débit de modèles ouverts de taille comparable. Sur PinchBench, l’entreprise annonce environ 86 % de précision et 10 000 tâches terminées 30 % plus rapidement que Qwen3.6 35B à précision similaire.

Ces résultats sont utiles pour comprendre la cible, mais ils proviennent du constructeur et d’un ensemble de tests précis. Ils ne garantissent pas que Nemotron 3.5 Lightning dominera dans chaque langue, chaque domaine ou chaque outil. Un déploiement professionnel doit mesurer la qualité des appels de fonctions, le taux d’erreur, le coût, la latence et la sécurité sur ses propres tâches.

NeMo Switchyard organise un système de plusieurs modèles

NVIDIA publie également NeMo Switchyard, une bibliothèque de routage. Elle peut diriger les tâches complexes vers un modèle de raisonnement plus puissant et les opérations simples vers Lightning. Cette approche évite d’utiliser le modèle le plus cher pour chaque action.

Le routage est important pour les agents « toujours actifs ». Une longue session peut produire des milliers d’appels techniques. Même une petite économie par requête devient significative à grande échelle. Le défi consiste à détecter correctement les tâches qui exigent davantage de raisonnement, faute de quoi le système peut économiser du calcul au prix d’une qualité plus faible.

Nemotron 4 et le modèle à mille milliards de paramètres

Reuters rapporte, en citant The Information et des personnes travaillant sur le projet, que NVIDIA développe une famille Nemotron 4. Sa plus grande version pourrait atteindre au moins mille milliards de paramètres. L’entraînement final ne serait pas terminé et une disponibilité à la fin de l’automne serait envisagée au plus tôt.

NVIDIA a confirmé travailler sur Nemotron 4 et défend l’idée de modèles de pointe accessibles. L’entreprise n’a cependant pas confirmé le nombre de paramètres, la composition de la gamme ni la date de sortie rapportés. Le conditionnel est donc indispensable.

Le nombre total de paramètres ne permettra pas, à lui seul, de juger le modèle. Une architecture MoE peut n’en activer qu’une fraction, comme Lightning. La qualité dépendra aussi des données, du post-entraînement, du contexte, de l’efficacité d’inférence et des évaluations indépendantes.

NVIDIA devient-il un concurrent direct des laboratoires d’IA ?

NVIDIA reste d’abord le principal fournisseur de matériel et de logiciels de calcul pour l’IA, mais Nemotron lui permet de contrôler davantage de couches : modèles, jeux de données, recettes d’entraînement, outils de routage et infrastructure d’inférence. La société peut ainsi stimuler la demande pour ses GPU tout en proposant une alternative ouverte aux API propriétaires.

Cette stratégie complète ses projets de financement des infrastructures IA avec des partenaires financiers. Elle ne signifie pas que NVIDIA abandonne ses alliances avec d’autres laboratoires. Au contraire, Switchyard est pensé pour combiner des modèles ouverts et fermés selon la tâche.

FAQ

Nemotron 3.5 Lightning est-il open source ?

NVIDIA parle d’un modèle ouvert et publie ses poids, certaines données et recettes sous licence OpenMDW 1.1. Il est plus précis de dire « open-weight » ou « modèle ouvert sous licence », car toutes les définitions de l’open source ne sont pas identiques.

Combien de paramètres sont réellement utilisés ?

Le modèle en compte 30 milliards au total et en active environ trois milliards grâce à son architecture Mixture-of-Experts.

Peut-il tourner sur une RTX 5090 ?

NVIDIA cite cette carte pour l’IA locale, notamment avec la version quantifiée NVFP4. Les performances dépendront du contexte, du logiciel et de la charge.

Nemotron 4 aura-t-il mille milliards de paramètres ?

C’est une information rapportée par The Information et Reuters, pas une caractéristique finale annoncée par NVIDIA.

Quand sortira Nemotron 4 ?

Aucune date officielle n’est fixée. Le reportage évoque une disponibilité possible à partir de la fin de l’automne 2026.

À quoi sert NeMo Switchyard ?

Cette bibliothèque route chaque tâche vers le modèle jugé le plus adapté, afin de combiner qualité, vitesse et coût.

Conclusion

Nemotron 3.5 Lightning est une sortie concrète et immédiatement testable. Son intérêt ne vient pas seulement de ses 30 milliards de paramètres, mais de l’activation de trois milliards à la fois, de la publication des poids et de son positionnement comme moteur d’exécution pour agents.

Nemotron 4 est une autre histoire : le projet existe, mais le trillion de paramètres et le calendrier restent non confirmés. NVIDIA affiche clairement son ambition de devenir un acteur majeur des modèles ouverts ; il faudra attendre les spécifications finales et les évaluations indépendantes pour savoir si cette ambition se transforme en leadership.

Sources

techpi avatar Albert
Albert

Journaliste tech depuis 2013, je suis Albert et je décrypte l'actualité high-tech pour la rendre claire et utile au quotidien. Spécialisé dans le hardware, les objets connectés et le gaming, je teste également les logiciels et les outils d'intelligence artificielle qui changent nos usages. Aussi fasciné par l'écosystème Apple que par les configurations PC les plus underground. Passé par plusieurs rédactions de référence comme MacPlus et Phonandroid, je mets cette expérience au service de tests transparents, impartiaux et ancrés dans un usage 100 % réel.
Contactez : contact@techpi.fr

Articles: 524