llama.cpp : exécuter un LLM localement
Llama CPP est un nouvel outil conçu pour exécuter des modèles de langage, directement en C/C++. Cet outil est spécialement optimisé pour les processeurs Apple Silicon grâce à l'utilisation de la technologie ARM NEON et du framework Accelerate. Il offre également une compatibilité AVX2 pour les systèmes basés sur des architectures x86. Fonctionnant principalement sur le CPU, Llama CPP intègre aussi la capacité de quantification 4 bits, renforçant ainsi son efficacité.