Text Generation Inference (TGI) é o servidor de nível de produção da Hugging Face para implantar e servir LLMs, com agrupamento contínuo, quantização e integração estreita com o Hub.
| Categoria | Servidor de inferência |
| Tipo | Servidor de inferência |
| Licença | Apache-2.0 |
| Executa localmente | Auto-hospedado |
| Construído com | Rust |
| Nível de habilidade | Avançado |
| Melhor para | equipes no ecossistema Hugging Face |
Outras ferramentas de servidor de inferência de código aberto que valem a pena comparar:
vLLMServiço de alta capacidade para produção
SGLangServiço rápido com saídas estruturadas
LMDeployKit de ferramentas para comprimir e servir LLMs
Aphrodite EngineServiço de LLM de alto desempenho
TensorRT-LLMMáxima taxa de transferência em GPUs NVIDIA
OpenLLMSirva qualquer modelo aberto como uma API OpenAI em um comando
KTransformersExecute enormes modelos MoE em uma GPU de consumidor
Ray ServeEscalone a entrega de modelos em um cluster
BentoMLEmpacote qualquer modelo em uma API de produçãoO TGI é gratuito e de código aberto (licença Apache-2.0), então você pode usar, auto-hospedar e modificar sem custo.
Sim. O TGI é projetado para rodar na sua própria máquina ou servidor, mantendo seus dados privados.
Alternativas populares de código aberto incluem vLLM, SGLang, LMDeploy. Veja as comparações acima para escolher.
Navegue pelo diretório completo de ferramentas, modelos e projetos de IA de código aberto — atualizado diariamente.
Navegue por todas as ferramentas →