Llama 3 8B в FP16 занимает около 16 ГБ VRAM, в квантизации Q4_K_M около 5 ГБ. Это позволяет запустить её даже на карте с 8 ГБ VRAM при использовании llama.cpp или Ollama. Llama 3 70B в FP16 требует примерно 140 ГБ, что не помещается на одну карту, но в квантизации INT4 опускается до 40 ГБ и комфортно работает на двух картах RTX 4090 или на одной A100 80 ГБ, если такая доступна. Наши тарифы охватывают весь диапазон.
Помимо VRAM важна оперативная память хостовой системы, поскольку часть весов и KV кеша может оффлоадиться в RAM. Минимум 32 ГБ для 8B моделей, от 128 ГБ для 70B в распределённом режиме. NVMe SSD на 500 ГБ и больше позволяет хранить несколько разных версий и квантизаций без постоянной выгрузки. Сетевой канал 1 Гбит/с покрывает первичную загрузку весов с Hugging Face за пять минут.