vLLM ist eine Hochdurchsatz-Inferenz- und Bereitstellungsengine, die PagedAttention verwendet, um die GPU-Auslastung zu maximieren, die Standardwahl für die Bereitstellung offener Modelle in großem Maßstab.
| Kategorie | Inference-Server |
| Typ | Inference-Server |
| Lizenz | Apache-2.0 |
| Läuft lokal | Selbstgehostet |
| Hergestellt mit | Python |
| Fähigkeitsstufe | Fortgeschritten |
| Am besten für | Produktionsteams, die Modelle in großem Maßstab bereitstellen |
Andere Open-Source-Inferenzserver-Tools, die einen Vergleich wert sind:
TGIHugging Face's Produktions-Textserver
SGLangSchnelle Bereitstellung mit strukturierten Ausgaben
LMDeployToolkit zum Komprimieren und Bereitstellen von LLMs
Aphrodite EngineHochdurchsatz-LLM-Bereitstellung
TensorRT-LLMMaximale Durchsatzrate auf NVIDIA GPUs
OpenLLMJedes offene Modell als OpenAI API mit einem Befehl bereitstellen
KTransformersFühren Sie riesige MoE-Modelle auf einer Verbraucher-GPU aus
Ray ServeSkalieren Sie das Modell-Serving über einen Cluster
BentoMLPacken Sie jedes Modell in eine Produktions-APIvLLM ist kostenlos und Open-Source (Apache-2.0-Lizenz), sodass Sie es kostenlos nutzen, selbst hosten und modifizieren können.
Ja. vLLM ist dafür ausgelegt, auf Ihrem eigenen Computer oder Server zu laufen und Ihre Daten privat zu halten.
Beliebte Open-Source-Alternativen sind TGI, SGLang, LMDeploy. Siehe die obenstehenden Vergleiche zur Auswahl.
Durchsuchen Sie das vollständige Verzeichnis von Open-Source-AI-Tools, Modellen und Projekten – täglich aktualisiert.
Alle Tools durchsuchen →