Inkling est un modèle open-weight multimodal mélange d'experts du Thinking Machines Lab, avec 41B de paramètres actifs sur 975B au total.
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de benchmark indépendants pour Inkling (batch), mesurés par Artificial Analysis. Plus c'est élevé, mieux c'est. Mode de mesure : xhigh.
Inkling (batch) est un modèle d'IA open-weight de Thinkingmachines. Vous pouvez le télécharger et le self-host gratuitement ; les prix ci-dessous sont les prix catalogue des API hébergées, suivis quotidiennement, pour quand vous préférez la commodité au self-hosting.
Inkling (batch) est un modèle de langage IA de Thinkingmachines. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 42.3 sur l'indice d'intelligence d'Artificial Analysis.
Les poids sont libres et ouverts — vous pouvez auto-héberger Inkling (batch) et ne rien payer par jeton. Si vous préférez une API hébergée, les prix indiqués sont de 1 $ par million de jetons en entrée et 4,05 $ par million de jetons en sortie.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 87.2%, Humanity's Last Exam 31.9%, Long Context Reasoning 73.3%, SciCode 46.1%, τ-Bench Banking 29.1%, Terminal-Bench 55.1%. Il est particulièrement utilisé pour génération de code.
Il génère environ 69.8 tokens par seconde, avec un délai médian 2.42s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. Inkling (batch) a des open weights, vous pouvez donc le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par jeton.