vLLM es un motor de inferencia y servicio de alto rendimiento que utiliza PagedAttention para maximizar la utilización de GPU, la opción predeterminada para servir modelos abiertos a gran escala.
| Categoría | Servidor de inferencia |
| Tipo | Servidor de inferencia |
| Licencia | Apache-2.0 |
| Ejecuta localmente | Autoalojado |
| Construido con | Python |
| Nivel de habilidad | Avanzado |
| Mejor para | equipos de producción sirviendo modelos a gran escala |
Otras herramientas de servidor de inferencia de código abierto que vale la pena comparar:
TGIServidor de texto de producción de Hugging Face
SGLangServicio rápido con salidas estructuradas
LMDeployConjunto de herramientas para comprimir y servir LLMs
Aphrodite EngineServicio de LLM de alto rendimiento
TensorRT-LLMMáximo rendimiento en GPUs NVIDIA
OpenLLMSirve cualquier modelo abierto como una API de OpenAI en un comando
KTransformersEjecuta enormes modelos MoE en una GPU de consumo
Ray ServeEscala el servicio de modelos a través de un clúster
BentoMLEmpaqueta cualquier modelo en una API de producciónvLLM es gratuito y de código abierto (licencia Apache-2.0), por lo que puedes usarlo, alojarlo tú mismo y modificarlo sin costo alguno.
Sí. vLLM está diseñado para ejecutarse en tu propia máquina o servidor, manteniendo tus datos privados.
Las alternativas de código abierto populares incluyen TGI, SGLang, LMDeploy. Consulta las comparaciones anteriores para elegir.
Navega por el directorio completo de herramientas, modelos y proyectos de IA de código abierto, actualizado diariamente.
Navega todas las herramientas →