NVIDIA Nemotron 3 Ultra é um modelo de raciocínio e orquestração de fronteira aberta da NVIDIA, com 55B de parâmetros ativos de um total de 550B (MoE).
Os preços são atualizados automaticamente — verificados diariamente em relação aos preços de lista dos provedores.
Pontuações de benchmark independentes para o Nemotron 3 Ultra (gratuito), medido pela Artificial Analysis. Quanto maior, melhor. Modo de medição: Reasoning.
Nemotron 3 Ultra (free) é um modelo de IA open-weight da NVIDIA. Você pode baixá-lo e fazer self-host gratuitamente; os preços abaixo são preços públicos de API hospedada, rastreados diariamente, para quando você preferir conveniência em vez de self-hosting.
Nemotron 3 Ultra (free) é um modelo de linguagem de IA da NVIDIA. É open-weight: você pode baixá-lo e executá-lo em seu próprio hardware, gratuitamente. Ele pontua 38.3 no índice de inteligência Artificial Analysis.
Os pesos são gratuitos e abertos — você pode auto-hospedar o Nemotron 3 Ultra (free) e não pagar nada por token. Se preferir uma API hospedada, os preços são Gratuito por milhão de tokens de entrada e Gratuito por milhão de tokens de saída.
Benchmarks independentes da Artificial Analysis dão a ele GPQA 86.7%, Humanity's Last Exam 28.4%, Long Context Reasoning 71%, SciCode 39.9%, IFBench 81.4%, τ²-Bench 83.3%, τ-Bench Banking 14.2%, Terminal-Bench 53.9%, Terminal-Bench Hard 36.4%. É particularmente usado para geração de código.
Ele gera cerca de 172.5 tokens por segundo, com uma mediana 1.2s de atraso antes do primeiro token. Medido independentemente pela Artificial Analysis.
Sim. Nemotron 3 Ultra (gratuito) tem open weights, então você pode baixá-lo e executá-lo em sua própria GPU ou servidor com ferramentas como Ollama, vLLM ou llama.cpp — sem custo por token.