NVIDIA Nemotron 3 Ultra est un modèle de raisonnement et d'orchestration à la frontière ouverte de NVIDIA, avec 55B de paramètres actifs sur 550B au total (MoE).
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de référence indépendants pour Nemotron 3 Ultra, mesurés par Artificial Analysis. Plus c'est élevé, mieux c'est. Mode de mesure : Reasoning.
Nemotron 3 Ultra est un modèle d'IA open-weight de NVIDIA. Vous pouvez le télécharger et le déployer en self-hosted gratuitement ; les prix ci-dessous sont les prix de liste de l'API hébergée, suivis quotidiennement, pour quand vous préférez la commodité au self-hosting.
Nemotron 3 Ultra est un modèle de langage IA de NVIDIA. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 38.3 sur l'indice d'intelligence d'Artificial Analysis.
Les poids sont gratuits et ouverts — vous pouvez auto-héberger Nemotron 3 Ultra et ne rien payer par jeton. Si vous préférez une API hébergée, les prix sont de 0,5 $ par million de jetons d'entrée et de 2,2 $ par million de jetons de sortie.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 86.7%, Humanity's Last Exam 28.4%, Long Context Reasoning 71%, SciCode 39.9%, IFBench 81.4%, τ²-Bench 83.3%, τ-Bench Banking 14.2%, Terminal-Bench 53.9%, Terminal-Bench Hard 36.4%. Il est particulièrement utilisé pour génération de code.
Il génère environ 172.5 tokens par seconde, avec un délai médian 1.2s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. Nemotron 3 Ultra a des open weights, vous pouvez donc le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par jeton.