Inkling est un modèle open-weight multimodal mélange d'experts du Thinking Machines Lab, avec 41B de paramètres actifs sur 975B au total.
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de référence indépendants pour Inkling (free), mesurés par Artificial Analysis. Plus c'est élevé, mieux c'est. Mode de mesure : xhigh.
Inkling (free) est un modèle d'IA open-weight de Thinkingmachines. Vous pouvez le télécharger et le self-host gratuitement ; les prix ci-dessous sont les prix publics de l'API hébergée, suivis quotidiennement, pour quand vous préférez la commodité au self-hosting.
Inkling (free) est un modèle de langage IA de Thinkingmachines. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 42.3 sur l'indice d'intelligence d'Artificial Analysis.
Les poids sont gratuits et ouverts — vous pouvez self-host Inkling (free) et ne rien payer par jeton. Si vous préférez une API hébergée, les prix publics sont gratuits par million de jetons d'entrée et gratuits par million de jetons de sortie.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 87.2%, Humanity's Last Exam 31.9%, Long Context Reasoning 73.3%, SciCode 46.1%, τ-Bench Banking 29.1%, Terminal-Bench 55.1%. Il est particulièrement utilisé pour génération de code.
Il génère environ 57.2 tokens par seconde, avec un délai médian 2.55s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. Inkling (free) a des open weights, donc vous pouvez le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par jeton.