vLLM é um motor de inferência e serviço de alta capacidade usando PagedAttention para maximizar a utilização da GPU, a escolha padrão para servir modelos abertos em grande escala.
| Categoria | Servidor de inferência |
| Tipo | Servidor de inferência |
| Licença | Apache-2.0 |
| Executa localmente | Auto-hospedado |
| Construído com | Python |
| Nível de habilidade | Avançado |
| Melhor para | equipes de produção servindo modelos em grande escala |
Outras ferramentas de servidor de inferência de código aberto que valem a pena comparar:
TGIServidor de texto de produção da Hugging Face
SGLangServiço rápido com saídas estruturadas
LMDeployKit de ferramentas para comprimir e servir LLMs
Aphrodite EngineServiço de LLM de alto desempenho
TensorRT-LLMMáxima taxa de transferência em GPUs NVIDIA
OpenLLMSirva qualquer modelo aberto como uma API OpenAI em um comando
KTransformersExecute enormes modelos MoE em uma GPU de consumidor
Ray ServeEscalone a entrega de modelos em um cluster
BentoMLEmpacote qualquer modelo em uma API de produçãoO vLLM é gratuito e de código aberto (licença Apache-2.0), então você pode usar, auto-hospedar e modificar sem custo.
Sim. O vLLM é projetado para rodar na sua própria máquina ou servidor, mantendo seus dados privados.
Alternativas populares de código aberto incluem TGI, SGLang, LMDeploy. Veja as comparações acima para escolher.
Navegue pelo diretório completo de ferramentas, modelos e projetos de IA de código aberto — atualizado diariamente.
Navegue por todas as ferramentas →