vLLM est un moteur d'inférence et de service à haut débit utilisant PagedAttention pour maximiser l'utilisation du GPU, le choix par défaut pour servir des modèles ouverts à grande échelle.
| Catégorie | Serveur d'inférence |
| Type | Serveur d'inférence |
| Licence | Apache-2.0 |
| S'exécute localement | Auto-hébergé |
| Construit avec | Python |
| Niveau de compétence | Avancé |
| Meilleur pour | équipes de production servant des modèles à grande échelle |
Autres outils de serveur d'inférence open-source à comparer :
TGIServeur de texte en production de Hugging Face
SGLangService rapide avec des sorties structurées
LMDeployBoîte à outils pour compresser et servir les LLMs
Aphrodite EngineService LLM à haut débit
TensorRT-LLMDébit maximal sur les GPU NVIDIA
OpenLLMServez n'importe quel modèle ouvert comme une API OpenAI en une commande
KTransformersExécutez d'énormes modèles MoE sur un GPU grand public
Ray ServeÉvoluez le service de modèles à travers un cluster
BentoMLEmballer n'importe quel modèle dans une API de productionvLLM est gratuit et open-source (licence Apache-2.0), vous pouvez donc l'utiliser, l'héberger vous-même et le modifier sans frais.
Oui. vLLM est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.
Les alternatives open-source populaires incluent TGI, SGLang, LMDeploy. Consultez les comparaisons ci-dessus pour choisir.
Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.
Parcourez tous les outils →