llama.cpp от Georgi Gerganov стал стандартом de facto для инференса LLM благодаря уникальным свойствам:
- Минимум зависимостей: Один бинарник без Python, PyTorch и CUDA рантайма. Размер - 5-10 MB.
- Квантизация: Поддержка Q2_K до Q8_0, IQ-quants - модели в 4 раза меньше при минимальной потере качества.
- Гибридный инференс: Часть слоёв на GPU, часть на CPU. Запуск 70B моделей на 24GB GPU + 64GB RAM.
- Cross-platform: Работает на x86, ARM, Apple Silicon, поддержка CUDA, ROCm, Metal, Vulkan.
- Производительность: Оптимизация под AVX-512, NEON, AMX. На CPU быстрее чем PyTorch в 3-5 раз.
- GGUF формат: Все метаданные модели в одном файле, простой обмен и хранение.
Anubiz Host предоставляет серверы с современными Xeon Scalable или EPYC Genoa, оптимизированными под AVX-512 BF16 для максимальной скорости llama.cpp.