*Ling-3.0-flash* é um *modelo Mixture-of-Experts (MoE) de 124B parâmetros*, com aproximadamente *5,1B parâmetros ativados por token*.
Os preços são atualizados automaticamente — verificados diariamente em relação aos preços de lista dos provedores.
Pontuações independentes de benchmark para Ling-3.0-flash, medidas pela Artificial Analysis. Quanto maior, melhor.
Ling-3.0-flash é um modelo de open weights da Inclusionai. Você pode baixá-lo e fazer self-host gratuitamente; os preços abaixo são preços de tabela de API hospedada, rastreados diariamente, para quando você preferir conveniência ao self-hosting.
Ling-3.0-flash é um modelo de linguagem de IA da Inclusionai. É open-weight: você pode baixá-lo e executá-lo em seu próprio hardware, gratuitamente. Ele pontua 37.8 no índice de inteligência Artificial Analysis.
Os pesos são gratuitos e abertos — você pode fazer self-host do Ling-3.0-flash e não pagar nada por token. Se preferir uma API hospedada, os preços de tabela são $0,02 por milhão de tokens de entrada e $0,06 por milhão de tokens de saída.
Benchmarks independentes da Artificial Analysis dão a ele GPQA 85.5%, Humanity's Last Exam 23.7%, Long Context Reasoning 67%, SciCode 41.1%, τ-Bench Banking 27.2%, Terminal-Bench 55.4%. É particularmente usado para geração de código.
Ele gera cerca de 406.5 tokens por segundo, com uma mediana 1.84s de atraso antes do primeiro token. Medido independentemente pela Artificial Analysis.
Sim. Ling-3.0-flash tem open weights, então você pode baixá-lo e executá-lo em sua própria GPU ou servidor com ferramentas como Ollama, vLLM ou llama.cpp — sem custo por token.