Last updated
    llama.cpp
    Livre

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023

    Aperçu

    Le 10 mars 2023, Georgi Gerganov a poussé le premier commit de llama.cpp sur GitHub. La bibliothèque, écrite en C et C++, visait à faire une chose : exécuter les modèles LLaMA de Meta sur un processeur d'ordinateur portable sans GPU. En quelques semaines, elle comptait des milliers d'étoiles et une communauté croissante de développeurs repoussant ses capacités.

    L'innovation clé est la quantification. En compressant les poids du modèle de nombres flottants 32 bits à des entiers 4 ou 8 bits à l'aide du format GGUF, llama.cpp réduit les besoins en mémoire de 75 % ou plus. Un modèle de 7 milliards de paramètres qui nécessiterait 28 Go de VRAM sur un GPU peut fonctionner avec moins de 6 Go de RAM système. Le format GGUF regroupe également le tokeniseur, le vocabulaire et le modèle de chat en un seul fichier, ce qui simplifie la distribution des modèles.

    llama.cpp prend en charge une gamme inhabituellement large de matériel : processeurs x86 avec AVX2, Apple Silicon via Metal, GPU NVIDIA avec CUDA, GPU AMD avec hipBLAS, GPU Intel avec SYCL, et même Vulkan. Le projet fournit des outils en ligne de commande pour la génération, l'évaluation comparative et la conversion de modèles, ainsi qu'un serveur HTTP léger. En 2025, il compte plus de 900 contributeurs et 69 000 étoiles GitHub. Des outils comme Ollama et LM Studio s'appuient directement sur llama.cpp, rendant l'inférence LLM locale accessible aux utilisateurs non techniques. La bibliothèque est devenue la norme de facto pour exécuter de grands modèles de langage sur du matériel grand public, permettant une expérimentation IA privée et économique sans dépendance au cloud.

    Mots-clés

    llama.cppGGUFquantificationLLM localinférenceopen-sourceGeorgi Gerganovinférence CPUapprentissage automatique

    Infos du livre

    Auteur
    Georgi Gerganov, Diego Devesa
    Publié
    2023-03-10
    Auteur
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    Liens

    Rejoindre la communauté

    fans en discussion