LMDeploy est un ensemble d'outils pour compresser, quantifier et servir des LLM avec un haut débit de requêtes via son moteur TurboMind.
| Catégorie | Serveur d'inférence |
| Type | Serveur d'inférence |
| Licence | Apache-2.0 |
| S'exécute localement | Auto-hébergé |
| Construit avec | Python |
| Niveau de compétence | Avancé |
| Meilleur pour | équipes optimisant le service quantifié |
Autres outils de serveur d'inférence open-source à comparer :
vLLMService à haut débit pour la production
TGIServeur de texte en production de Hugging Face
SGLangService rapide avec des sorties structurées
Aphrodite EngineService LLM à haut débit
TensorRT-LLMDébit maximal sur les GPU NVIDIA
OpenLLMServez n'importe quel modèle ouvert comme une API OpenAI en une commande
KTransformersExécutez d'énormes modèles MoE sur un GPU grand public
Ray ServeÉvoluez le service de modèles à travers un cluster
BentoMLEmballer n'importe quel modèle dans une API de productionLMDeploy est gratuit et open-source (licence Apache-2.0), vous pouvez l'utiliser, l'héberger vous-même et le modifier sans frais.
Oui. LMDeploy est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.
Les alternatives open-source populaires incluent vLLM, TGI, SGLang. Consultez les comparaisons ci-dessus pour choisir.
Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.
Parcourez tous les outils →