GLM-5.3-Flash est un modèle multimodal natif de Z.ai.
Les prix se mettent à jour automatiquement — vérifiés quotidiennement par rapport aux prix catalogue des fournisseurs.
Scores de benchmark indépendants pour GLM 5.3 Flash (batch), mesurés par Artificial Analysis. Un score plus élevé est meilleur.
GLM 5.3 Flash (batch) est un modèle d'IA open-weight de Z.AI. Vous pouvez le télécharger et le self-host gratuitement ; les prix ci-dessous sont les prix de liste de l'API hébergée, suivis quotidiennement, pour quand vous préférez la commodité au self-hosting.
GLM 5.3 Flash (batch) est un modèle de langage IA de Z.AI. Il est open-weight : vous pouvez le télécharger et l'exécuter sur votre propre matériel, gratuitement. Il obtient un score de 41.8 sur l'indice d'intelligence d'Artificial Analysis.
The weights are free and open — you can self-host GLM 5.3 Flash (batch) and pay nothing per token. If you prefer a hosted API, list prices are $0.06 per million input tokens and $0.2 per million output tokens.
Des benchmarks indépendants d'Artificial Analysis lui donnent GPQA 91.2%, Humanity's Last Exam 39.9%, Long Context Reasoning 80%, SciCode 51.6%, τ-Bench Banking 47.2%, Terminal-Bench 84.3%. Il est particulièrement utilisé pour génération de code.
Il génère environ 46.9 tokens par seconde, avec un délai médian 3.16s avant le premier token. Mesuré indépendamment par Artificial Analysis.
Oui. GLM 5.3 Flash (batch) a des open weights, donc vous pouvez le télécharger et l'exécuter sur votre propre GPU ou serveur avec des outils comme Ollama, vLLM ou llama.cpp — sans coût par jeton.