Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão menor do vLLM
Aprenda a construir um motor rápido para executar grandes modelos de linguagem com C++ e CUDA.
Reivindique a sua pagina: indexada seja qual for a posicao, traduzida em seis linguas e enriquecida com as suas palavras.
Receba um alerta por e-mail no próximo lançamento ou quando começar a bombar.
Grátis · sem cartão · cancele quando quiserConstrua seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão menor do vLLM
tiny-vllm tem 961 estrelas no GitHub. Foi bifurcado 69 vezes. tiny-vllm é escrito principalmente em C++. Está em desenvolvimento ativo desde 2026. tiny-vllm está disponível sob a licença Apache-2.0. Os seus principais temas são: ai, attention, batching, course.
Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão menor do vLLM
tiny-vllm é um projeto de código aberto. É distribuído sob a licença Apache-2.0.
Sim. tiny-vllm é gratuito e de código aberto — você pode usá-lo, modificá-lo e hospedá-lo por conta própria.
tiny-vllm está disponível sob a licença Apache-2.0.
tiny-vllm é escrito principalmente em C++.
Adicione este badge ao vivo ao seu README — suas estrelas do GitHub e classificação no diretório, atualizadas diariamente.
[](https://opensourceai.tech/project/jmaczan-tiny-vllm.html)