LMDeploy é um conjunto de ferramentas para comprimir, quantizar e servir LLMs com alta taxa de requisições através de seu motor TurboMind.
| Categoria | Servidor de inferência |
| Tipo | Servidor de inferência |
| Licença | Apache-2.0 |
| Executa localmente | Auto-hospedado |
| Construído com | Python |
| Nível de habilidade | Avançado |
| Melhor para | equipes otimizando o serviço quantizado |
Outras ferramentas de servidor de inferência de código aberto que valem a pena comparar:
vLLMServiço de alta capacidade para produção
TGIServidor de texto de produção da Hugging Face
SGLangServiço rápido com saídas estruturadas
Aphrodite EngineServiço de LLM de alto desempenho
TensorRT-LLMMáxima taxa de transferência em GPUs NVIDIA
OpenLLMSirva qualquer modelo aberto como uma API OpenAI em um comando
KTransformersExecute enormes modelos MoE em uma GPU de consumidor
Ray ServeEscalone a entrega de modelos em um cluster
BentoMLEmpacote qualquer modelo em uma API de produçãoO LMDeploy é gratuito e de código aberto (licença Apache-2.0), então você pode usar, auto-hospedar e modificar sem custo.
Sim. O LMDeploy é projetado para rodar na sua própria máquina ou servidor, mantendo seus dados privados.
Alternativas populares de código aberto incluem vLLM, TGI, SGLang. Veja as comparações acima para escolher.
Navegue pelo diretório completo de ferramentas, modelos e projetos de IA de código aberto — atualizado diariamente.
Navegue por todas as ferramentas →