Lama.cpp est un moteur open-source qui fait tourner des modèles d’IA (comme Llama) directement sur votre ordinateur, sans serveur, sans compte, sans internet. C’est le « moteur sous le capot » de nombreux logiciels comme LM Studio ou Jan. Il est écrit en C++ pour être rapide et fonctionner même sur des machines modestes.
C’est l’outil le plus performant et le plus personnalisable pour l’IA locale. Si vous voulez la meilleure vitesse ou contrôler finement chaque paramètre, c’est pour vous.
Pour qui & quand : plutôt pour les utilisateurs intermédiaires/techniques qui n’ont pas peur de la ligne de commande. Les débutants préféreront LM Studio ou Jan qui ont une interface graphique.
Installer & utiliser : Téléchargez un binaire depuis GitHub ou compilez-le. Ça s’utilise en ligne de commande (llama-cli -m modele.gguf) ou avec une interface web via llama-server.
Lien vers le dépôt GitHub : github.com/ggml-org/llama.cpp