LMDeploy ist ein Toolkit zum Komprimieren, Quantisieren und Bereitstellen von LLMs mit hoher Anfragenrate über die TurboMind-Engine.
| Kategorie | Inference-Server |
| Typ | Inference-Server |
| Lizenz | Apache-2.0 |
| Läuft lokal | Selbstgehostet |
| Hergestellt mit | Python |
| Fähigkeitsstufe | Fortgeschritten |
| Am besten für | Teams, die quantisierte Bereitstellung optimieren |
Andere Open-Source-Inferenzserver-Tools, die einen Vergleich wert sind:
vLLMHochdurchsatzbereitstellung für die Produktion
TGIHugging Face's Produktions-Textserver
SGLangSchnelle Bereitstellung mit strukturierten Ausgaben
Aphrodite EngineHochdurchsatz-LLM-Bereitstellung
TensorRT-LLMMaximale Durchsatzrate auf NVIDIA GPUs
OpenLLMJedes offene Modell als OpenAI API mit einem Befehl bereitstellen
KTransformersFühren Sie riesige MoE-Modelle auf einer Verbraucher-GPU aus
Ray ServeSkalieren Sie das Modell-Serving über einen Cluster
BentoMLPacken Sie jedes Modell in eine Produktions-APILMDeploy ist kostenlos und Open Source (Apache-2.0-Lizenz), sodass Sie es ohne Kosten verwenden, selbst hosten und modifizieren können.
Ja. LMDeploy ist dafür ausgelegt, auf Ihrem eigenen Computer oder Server zu laufen und Ihre Daten privat zu halten.
Beliebte Open-Source-Alternativen sind vLLM, TGI, SGLang. Siehe die Vergleiche oben zur Auswahl.
Durchsuchen Sie das vollständige Verzeichnis von Open-Source-AI-Tools, Modellen und Projekten – täglich aktualisiert.
Alle Tools durchsuchen →