llama.cpp : chạy một LLM cục bộ
Llama CPP là một công cụ mới được thiết kế để thực hiện các mô hình ngôn ngữ trực tiếp trên C/C++. Công cụ này được tối ưu hóa đặc biệt cho các bộ xử lý Apple Silicon thông qua việc sử dụng công nghệ ARM NEON và bộ khung Accelerate. Nó cũng cung cấp khả năng tương thích AVX2 cho các hệ thống dựa trên kiến trúc x86. Chạy chủ yếu trên CPU, Llama CPP còn tích hợp khả năng lượng tử hóa 4 bit, từ đó cải thiện thêm hiệu quả.