LMDeploy es un conjunto de herramientas para comprimir, cuantificar y servir LLMs con un alto rendimiento de solicitudes a través de su motor TurboMind.
| Categoría | Servidor de inferencia |
| Tipo | Servidor de inferencia |
| Licencia | Apache-2.0 |
| Ejecuta localmente | Autoalojado |
| Construido con | Python |
| Nivel de habilidad | Avanzado |
| Mejor para | equipos optimizando el servicio cuantificado |
Otras herramientas de servidor de inferencia de código abierto que vale la pena comparar:
vLLMServicio de alto rendimiento para producción
TGIServidor de texto de producción de Hugging Face
SGLangServicio rápido con salidas estructuradas
Aphrodite EngineServicio de LLM de alto rendimiento
TensorRT-LLMMáximo rendimiento en GPUs NVIDIA
OpenLLMSirve cualquier modelo abierto como una API de OpenAI en un comando
KTransformersEjecuta enormes modelos MoE en una GPU de consumo
Ray ServeEscala el servicio de modelos a través de un clúster
BentoMLEmpaqueta cualquier modelo en una API de producciónLMDeploy es gratuito y de código abierto (licencia Apache-2.0), por lo que puedes usarlo, autoalojarlo y modificarlo sin costo alguno.
Sí. LMDeploy está diseñado para ejecutarse en tu propia máquina o servidor, manteniendo tus datos privados.
Las alternativas populares de código abierto incluyen vLLM, TGI, SGLang. Consulta las comparaciones anteriores para elegir.
Navega por el directorio completo de herramientas, modelos y proyectos de IA de código abierto, actualizado diariamente.
Navega todas las herramientas →