TensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von großen Sprachmodellen (LLMs) und unterstützt modernste Optimierungen, um Inferenz effizient auf NVIDIA-GPUs durchzuführen. TensorRT LLM enthält auch Komponenten zur Erstellung von Python- und C++-Laufzeiten.
Optimiere und führe große Sprachmodelle auf NVIDIA-GPUs mit einer benutzerfreundlichen Python-Schnittstelle aus.
Beanspruchen Sie die Seite: indexiert unabhangig vom Rang, in sechs Sprachen ubersetzt und mit Ihren eigenen Worten erganzt.
Erhalten Sie eine E-Mail-Benachrichtigung beim nächsten Release oder wenn es durchstartet.
Kostenlos · ohne Karte · jederzeit abbestellbarTensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von großen Sprachmodellen (LLMs) und unterstützt modernste Optimierungen, um Inferenz effizient auf NVIDIA-GPUs durchzuführen. TensorRT LLM enthält auch Komponenten zur Erstellung von Python- und C++-Laufzeiten.
TensorRT-LLM hat 14.2k Sterne auf GitHub. Es wurde 2.6k-mal geforkt. TensorRT-LLM ist hauptsächlich in Python geschrieben. Es wird seit 2023 aktiv entwickelt. Die Hauptthemen sind: blackwell, cuda, llm-serving, moe.
Read the full guideTensorRT LLM bietet Benutzern eine benutzerfreundliche Python-API zum Definieren von großen Sprachmodellen (LLMs) und unterstützt modernste Optimierungen, um Inferenz effizient auf NVIDIA-GPUs durchzuführen. TensorRT LLM enthält auch Komponenten zur Erstellung von Python- und C++-Laufzeiten.
TensorRT-LLM ist ein Open-Source-Projekt.
Ja. TensorRT-LLM ist kostenlos und Open Source — Sie können es nutzen, anpassen und selbst hosten.
TensorRT-LLM ist hauptsächlich in Python geschrieben.
Fügen Sie dieses Live-Abzeichen zu Ihrem README hinzu — Ihre GitHub-Sterne und Verzeichnisrang, täglich aktualisiert.
[](https://opensourceai.tech/project/nvidia-tensorrt-llm.html)
Ermittelt aus gemeinsamen GitHub-Topics beider Projekte, gewichtet nach ihrer Seltenheit.