Construisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version plus petite de vLLM
Apprenez à construire un moteur rapide pour exécuter des modèles de langage large avec C++ et CUDA.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout momentConstruisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version plus petite de vLLM
tiny-vllm compte 961 étoiles sur GitHub. Il a été forké 69 fois. tiny-vllm est écrit principalement en C++. Il est développé activement depuis 2026. tiny-vllm est disponible sous licence Apache-2.0. Ses principaux thèmes sont : ai, attention, batching, course.
Construisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version plus petite de vLLM
tiny-vllm est un projet open source. Il est distribué sous licence Apache-2.0.
Oui. tiny-vllm est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
tiny-vllm est disponible sous licence Apache-2.0.
tiny-vllm est écrit principalement en C++.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://olud.ai/project/jmaczan-tiny-vllm.html)