Text Generation Inference (TGI) est le serveur de production de Hugging Face pour déployer et servir les LLMs, avec un traitement par lots continu, une quantification et une intégration étroite avec le Hub.
| Catégorie | Serveur d'inférence |
| Type | Serveur d'inférence |
| Licence | Apache-2.0 |
| S'exécute localement | Auto-hébergé |
| Construit avec | Rust |
| Niveau de compétence | Avancé |
| Meilleur pour | équipes dans l'écosystème Hugging Face |
Autres outils de serveur d'inférence open-source à comparer :
vLLMService à haut débit pour la production
SGLangService rapide avec des sorties structurées
LMDeployBoîte à outils pour compresser et servir les LLMs
Aphrodite EngineService LLM à haut débit
TensorRT-LLMDébit maximal sur les GPU NVIDIA
OpenLLMServez n'importe quel modèle ouvert comme une API OpenAI en une commande
KTransformersExécutez d'énormes modèles MoE sur un GPU grand public
Ray ServeÉvoluez le service de modèles à travers un cluster
BentoMLEmballer n'importe quel modèle dans une API de productionTGI est gratuit et open-source (licence Apache-2.0), vous pouvez donc l'utiliser, l'héberger vous-même et le modifier sans frais.
Oui. TGI est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.
Les alternatives open-source populaires incluent vLLM, SGLang, LMDeploy. Consultez les comparaisons ci-dessus pour choisir.
Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.
Parcourez tous les outils →