VRAM - главный лимитирующий фактор для LLM. Базовые ориентиры с 4-bit квантизацией (GGUF, AWQ):
- 8 ГБ VRAM (RTX 3060 Ti): Llama 3 8B, Mistral 7B, Qwen 2.5 7B - быстрый отклик, базовое качество.
- 16 ГБ VRAM (RTX 4070 Ti, A4000): Llama 3 13B, Codestral 22B, Mixtral 8x7B в 3-bit.
- 24 ГБ VRAM (RTX 4090, A5000): Llama 3 30B, Qwen 2.5 32B - качество близкое к GPT-4 для многих задач.
- 40 ГБ VRAM (A100 40GB): Llama 3 70B в 4-bit, отличное качество ответов.
- 80 ГБ VRAM (A100 80GB, H100): Llama 3.1 70B в 8-bit, Mixtral 8x22B, DeepSeek V3 квантизация.
Для большинства практических задач Llama 3 13B или Mistral 7B на RTX 4090 покажут отличный результат при потреблении ~150-200 Вт.