Python

vLLM

Service à haut débit pour la production
par vllm-project · Apache-2.0
90 619étoiles21 495forksPythonlangue9 il y a quelques joursdernière poussée
Serveur d'inférenceServeur d'inférenceApache-2.0Auto-hébergéPythonAvancé

Depuis le README

Installer
uv pip install vllm
Documentation ↗

Extraits du README du projet sur GitHub. Le droit d'auteur et les licences restent la propriété des auteurs respectifs.

Un nombre élevé signifie généralement que le projet est fortement examiné. Un nombre faible signifie généralement qu'il est peu examiné — cela ne veut pas dire qu'il est sûr.
Aucun signal d'activité publique pour cet outil — il n'a pas de dépôt ouvert que nous pouvons mesurer.
Olud Pulse ⓘ ★★★★★★★★★★ /100 signaux suivis
🐳 téléchargements Docker 📦 téléchargements PyPI / mois 📦 téléchargements npm / mois 🚀 Dernière version ·
Visitez le site →Voir sur GitHub

Qu'est-ce que vLLM ?

vLLM est un moteur d'inférence et de service à haut débit utilisant PagedAttention pour maximiser l'utilisation du GPU, le choix par défaut pour servir des modèles ouverts à grande échelle.

Pourquoi les gens choisissent vLLM

vLLM en un coup d'œil

CatégorieServeur d'inférence
TypeServeur d'inférence
LicenceApache-2.0
S'exécute localementAuto-hébergé
Construit avecPython
Niveau de compétenceAvancé
Meilleur pouréquipes de production servant des modèles à grande échelle
Voir les statistiques et l'activité GitHub

Alternatives open-source à vLLM

Autres outils de serveur d'inférence open-source à comparer :

TGIServeur de texte en production de Hugging FaceSGLangService rapide avec des sorties structuréesLMDeployBoîte à outils pour compresser et servir les LLMsAphrodite EngineService LLM à haut débitTensorRT-LLMDébit maximal sur les GPU NVIDIAOpenLLMServez n'importe quel modèle ouvert comme une API OpenAI en une commandeKTransformersExécutez d'énormes modèles MoE sur un GPU grand publicRay ServeÉvoluez le service de modèles à travers un clusterBentoMLEmballer n'importe quel modèle dans une API de production

vLLM en tête-à-tête

vLLM vs TGIvLLM vs SGLangvLLM vs LMDeployvLLM vs Aphrodite EnginevLLM vs TensorRT-LLMvLLM vs OpenLLMvLLM vs KTransformersvLLM vs Ray ServevLLM vs BentoML

FAQ

vLLM est-il gratuit ?

vLLM est gratuit et open-source (licence Apache-2.0), vous pouvez donc l'utiliser, l'héberger vous-même et le modifier sans frais.

Puis-je exécuter vLLM localement ?

Oui. vLLM est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.

Quelle est la meilleure alternative à vLLM ?

Les alternatives open-source populaires incluent TGI, SGLang, LMDeploy. Consultez les comparaisons ci-dessus pour choisir.

Explorez plus d'IA open-source

Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.

Parcourez tous les outils →