llama.cpp est le moteur d'inférence C/C++ haute performance qui sous-tend la plupart des outils LLM locaux, prenant en charge les modèles GGUF avec une quantification agressive sur CPU et GPU.
| Catégorie | Exécuter des LLM localement |
| Type | Bibliothèque d'inférence (C/C++) |
| Licence | MIT |
| S'exécute localement | Oui |
| Construit avec | C/C++ |
| Niveau de compétence | Avancé |
| Meilleur pour | développeurs qui veulent un contrôle et une portabilité maximaux |
Autres outils open-source pour exécuter des LLM localement qui valent la peine d'être comparés :
OllamaExécuter des LLM open-source localement avec une seule commande
JanApplication de bureau de style ChatGPT open-source et hors ligne
GPT4AllIA locale privée qui s'exécute sur CPU
LocalAIUne API OpenAI à auto-héberger
Text Generation WebUIInterface web riche en fonctionnalités pour les modèles locaux
KoboldCppExécuteur de modèle local en un seul fichier
MLC LLMExécuter des LLM sur n'importe quel appareil, même les téléphones
llamafileUn fichier exécutable = modèle + runtime
exoExécutez de grands modèles sur vos appareils quotidiens
CortexRuntime de style Ollama de l'équipe Jan
Nexa SDKExécutez n'importe quel modèle sur n'importe quel appareil — CPU, GPU, NPU
RamaLamaExécutez des modèles en tant que conteneurs OCI
GPUStackGérez des clusters GPU pour exécuter des modèlesllama.cpp est gratuit et open-source (licence MIT), vous pouvez l'utiliser, l'héberger vous-même et le modifier sans frais.
Oui. llama.cpp est conçu pour fonctionner sur votre propre machine ou serveur, gardant vos données privées.
Les alternatives open-source populaires incluent Ollama, LM Studio, Jan. Consultez les comparaisons ci-dessus pour choisir.
Parcourez le répertoire complet des outils, modèles et projets d'IA open-source — mis à jour quotidiennement.
Parcourez tous les outils →