Text Generation Inference (TGI) ist Hugging Faces produktionsreifer Server zum Bereitstellen und Servieren von LLMs, mit kontinuierlichem Batching, Quantisierung und enger Hub-Integration.
| Kategorie | Inference-Server |
| Typ | Inference-Server |
| Lizenz | Apache-2.0 |
| Läuft lokal | Selbstgehostet |
| Hergestellt mit | Rust |
| Fähigkeitsstufe | Fortgeschritten |
| Am besten für | Teams im Hugging Face-Ökosystem |
Andere Open-Source-Inferenzserver-Tools, die einen Vergleich wert sind:
vLLMHochdurchsatzbereitstellung für die Produktion
SGLangSchnelle Bereitstellung mit strukturierten Ausgaben
LMDeployToolkit zum Komprimieren und Bereitstellen von LLMs
Aphrodite EngineHochdurchsatz-LLM-Bereitstellung
TensorRT-LLMMaximale Durchsatzrate auf NVIDIA GPUs
OpenLLMJedes offene Modell als OpenAI API mit einem Befehl bereitstellen
KTransformersFühren Sie riesige MoE-Modelle auf einer Verbraucher-GPU aus
Ray ServeSkalieren Sie das Modell-Serving über einen Cluster
BentoMLPacken Sie jedes Modell in eine Produktions-APITGI ist kostenlos und Open-Source (Apache-2.0-Lizenz), sodass Sie es kostenlos nutzen, selbst hosten und modifizieren können.
Ja. TGI ist dafür ausgelegt, auf Ihrem eigenen Computer oder Server zu laufen und Ihre Daten privat zu halten.
Beliebte Open-Source-Alternativen sind vLLM, SGLang, LMDeploy. Siehe die obenstehenden Vergleiche zur Auswahl.
Durchsuchen Sie das vollständige Verzeichnis von Open-Source-AI-Tools, Modellen und Projekten – täglich aktualisiert.
Alle Tools durchsuchen →