Полное обучение LLM требует огромных ресурсов и обычно делается только крупными лабораториями. Для большинства production задач достаточно тонкой настройки через LoRA или QLoRA, которые тренируют небольшое количество дополнительных параметров поверх замороженной базовой модели. LoRA на 7B модели в FP16 требует около 16 ГБ VRAM, QLoRA на той же модели работает в 4 бит и снижает требование до 8 ГБ VRAM. Это позволяет тренировать на одном GPU RTX 4090 модели уровня 13B и при необходимости 70B через distributed setup.
Полное обучение 7B модели или серьёзный supervised fine tuning без LoRA требует 80 ГБ VRAM или больше, что доступно через distributed training на двух или более картах с FSDP или DeepSpeed. Наши dedicated тарифы поддерживают такие конфигурации с проброшенными в VM двумя картами RTX 4090 или A5000. RAM от 64 ГБ на хосте обеспечивает плавную работу с большими батчами и тяжёлыми датасетами в памяти.