
llama.cpp
Georgi Gerganov, Diego Devesa
Aperçu
Le 10 mars 2023, Georgi Gerganov a poussé le premier commit de llama.cpp sur GitHub. La bibliothèque, écrite en C et C++, visait à faire une chose : exécuter les modèles LLaMA de Meta sur un processeur d'ordinateur portable sans GPU. En quelques semaines, elle comptait des milliers d'étoiles et une communauté croissante de développeurs repoussant ses capacités.
L'innovation clé est la quantification. En compressant les poids du modèle de nombres flottants 32 bits à des entiers 4 ou 8 bits à l'aide du format GGUF, llama.cpp réduit les besoins en mémoire de 75 % ou plus. Un modèle de 7 milliards de paramètres qui nécessiterait 28 Go de VRAM sur un GPU peut fonctionner avec moins de 6 Go de RAM système. Le format GGUF regroupe également le tokeniseur, le vocabulaire et le modèle de chat en un seul fichier, ce qui simplifie la distribution des modèles.
llama.cpp prend en charge une gamme inhabituellement large de matériel : processeurs x86 avec AVX2, Apple Silicon via Metal, GPU NVIDIA avec CUDA, GPU AMD avec hipBLAS, GPU Intel avec SYCL, et même Vulkan. Le projet fournit des outils en ligne de commande pour la génération, l'évaluation comparative et la conversion de modèles, ainsi qu'un serveur HTTP léger. En 2025, il compte plus de 900 contributeurs et 69 000 étoiles GitHub. Des outils comme Ollama et LM Studio s'appuient directement sur llama.cpp, rendant l'inférence LLM locale accessible aux utilisateurs non techniques. La bibliothèque est devenue la norme de facto pour exécuter de grands modèles de langage sur du matériel grand public, permettant une expérimentation IA privée et économique sans dépendance au cloud.
Mots-clés
Infos du livre
- Auteur
- Georgi Gerganov, Diego Devesa
- Publié
- 2023-03-10
- Auteur
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
Rejoindre la communauté
fans en discussion