*Ling-3.0-flash* est un *modèle Mixture-of-Experts (MoE) de 124B paramètres*, avec environ *5,1B paramètres activés par token*.
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de benchmark indépendants pour Ling-3.0-flash, mesurés par Artificial Analysis. Plus le score est élevé, mieux c'est.
Ling-3.0-flash est un modèle d'IA open-weight de Inclusionai. Vous pouvez le télécharger et le self-host gratuitement ; les prix ci-dessous sont les prix catalogue de l'API hébergée, suivis quotidiennement, pour quand vous préférez la commodité au self-hosting.
Ling-3.0-flash est un modèle de langage IA de Inclusionai. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 37.8 sur l'indice d'intelligence d'Artificial Analysis.
Les poids sont libres et ouverts — vous pouvez self-host Ling-3.0-flash et ne rien payer par token. Si vous préférez une API hébergée, les prix catalogue sont de 0,02 $ par million de tokens d'entrée et 0,06 $ par million de tokens de sortie.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 85.5%, Humanity's Last Exam 23.7%, Long Context Reasoning 67%, SciCode 41.1%, τ-Bench Banking 27.2%, Terminal-Bench 55.4%. Il est particulièrement utilisé pour génération de code.
Il génère environ 406.5 tokens par seconde, avec un délai médian 1.84s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. Ling-3.0-flash a des open weights, donc vous pouvez le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par token.