TensorRT LLM fournit aux utilisateurs une API Python facile à utiliser pour définir des modèles de langage large (LLMs) et prend en charge des optimisations à la pointe de la technologie pour effectuer des inférences efficacement sur les GPU NVIDIA. TensorRT LLM contient également des composants pour créer des environnements d'exécution Python et C++
Optimisez et exécutez de grands modèles de langage sur des GPU NVIDIA avec une interface Python facile à utiliser.
Revendiquez sa page : indexée quel que soit son rang, traduite en six langues, et enrichie de vos propres mots.
Recevez une alerte par e-mail à sa prochaine version ou quand il décolle — ne ratez plus rien.
Gratuit · sans carte · désinscription à tout momentTensorRT LLM fournit aux utilisateurs une API Python facile à utiliser pour définir des modèles de langage large (LLMs) et prend en charge des optimisations à la pointe de la technologie pour effectuer des inférences efficacement sur les GPU NVIDIA. TensorRT LLM contient également des composants pour créer des environnements d'exécution Python et C++
TensorRT-LLM compte 14.2k étoiles sur GitHub. Il a été forké 2.6k fois. TensorRT-LLM est écrit principalement en Python. Il est développé activement depuis 2023. Ses principaux thèmes sont : blackwell, cuda, llm-serving, moe.
Read the full guideTensorRT LLM fournit aux utilisateurs une API Python facile à utiliser pour définir des modèles de langage large (LLMs) et prend en charge des optimisations à la pointe de la technologie pour effectuer des inférences efficacement sur les GPU NVIDIA. TensorRT LLM contient également des composants pour créer des environnements d'exécution Python et C++
TensorRT-LLM est un projet open source.
Oui. TensorRT-LLM est gratuit et open source — vous pouvez l'utiliser, le modifier et l'héberger vous-même.
TensorRT-LLM est écrit principalement en Python.
Ajoutez ce badge en direct à votre README — vos étoiles GitHub et votre classement dans le répertoire, actualisés quotidiennement.
[](https://olud.ai/project/nvidia-tensorrt-llm.html)
Mesuré à partir des topics GitHub communs aux deux projets, pondérés par leur rareté.