GLM-5.3-Flash est un modèle multimodal natif de Z.ai.
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de référence indépendants pour GLM 5.3 Flash, mesurés par Artificial Analysis. Plus c'est élevé, mieux c'est.
GLM 5.3 Flash est un modèle d'IA à poids ouverts de Z.AI. Vous pouvez le télécharger et l'auto-héberger gratuitement ; les prix ci-dessous sont les prix catalogue des API hébergées, suivis quotidiennement, pour quand vous préférez la commodité à l'auto-hébergement.
GLM 5.3 Flash est un modèle de langage IA de Z.AI. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 57.5 sur l'indice d'intelligence d'Artificial Analysis.
Les poids sont gratuits et ouverts — vous pouvez auto-héberger GLM 5.3 Flash et ne rien payer par jeton. Si vous préférez une API hébergée, les prix catalogue sont de $0.08 par million de jetons d'entrée et $0.25 par million de jetons de sortie.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 91.2%, Humanity's Last Exam 39.9%, Long Context Reasoning 78%, SciCode 46.1%, τ-Bench Banking 47.2%, Terminal-Bench 84.3%. Il est particulièrement utilisé pour génération de code.
Il génère environ 49.2 tokens par seconde, avec un délai médian 1.18s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. GLM 5.3 Flash a des poids ouverts, vous pouvez donc le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par jeton.