llama.cpp : ejecutar un LLM localmente
Llama CPP es una nueva herramienta diseñada para ejecutar modelos de lenguaje, directamente en C/C++. Esta herramienta está especialmente optimizada para los procesadores Apple Silicon gracias al uso de la tecnología ARM NEON y del framework Accelerate. También ofrece compatibilidad AVX2 para sistemas basados en arquitecturas x86. Funcionando principalmente en la CPU, Llama CPP también integra la capacidad de cuantificación de 4 bits, aumentando así su eficiencia.