Text Generation Inference (TGI) es el servidor de calidad de producción de Hugging Face para desplegar y servir LLMs, con agrupamiento continuo, cuantización e integración estrecha con el Hub.
| Categoría | Servidor de inferencia |
| Tipo | Servidor de inferencia |
| Licencia | Apache-2.0 |
| Ejecuta localmente | Autoalojado |
| Construido con | Rust |
| Nivel de habilidad | Avanzado |
| Mejor para | equipos en el ecosistema de Hugging Face |
Otras herramientas de servidor de inferencia de código abierto que vale la pena comparar:
vLLMServicio de alto rendimiento para producción
SGLangServicio rápido con salidas estructuradas
LMDeployConjunto de herramientas para comprimir y servir LLMs
Aphrodite EngineServicio de LLM de alto rendimiento
TensorRT-LLMMáximo rendimiento en GPUs NVIDIA
OpenLLMSirve cualquier modelo abierto como una API de OpenAI en un comando
KTransformersEjecuta enormes modelos MoE en una GPU de consumo
Ray ServeEscala el servicio de modelos a través de un clúster
BentoMLEmpaqueta cualquier modelo en una API de producciónTGI es gratuito y de código abierto (licencia Apache-2.0), por lo que puedes usarlo, alojarlo tú mismo y modificarlo sin costo alguno.
Sí. TGI está diseñado para ejecutarse en tu propia máquina o servidor, manteniendo tus datos privados.
Las alternativas de código abierto populares incluyen vLLM, SGLang, LMDeploy. Consulta las comparaciones anteriores para elegir.
Navega por el directorio completo de herramientas, modelos y proyectos de IA de código abierto, actualizado diariamente.
Navega todas las herramientas →