Три основных подхода к fine-tuning с разными trade-offs:
- Full fine-tuning: Обновление всех параметров модели. Лучшее качество, но требует огромной VRAM. Llama 70B - 8x A100 80GB.
- LoRA (Low-Rank Adaptation): Добавление маленьких rank-r матриц к attention layers. 0.1-1% от исходных параметров. Llama 70B - 2-3x A100.
- QLoRA: LoRA на квантизированной (4-bit) базовой модели. Llama 70B можно fine-tune на одной 48GB GPU.
- DoRA: Improved LoRA с weight decomposition. Качество ближе к full fine-tuning при тех же ресурсах.
- Galore: Gradient low-rank projection. Полный fine-tuning Llama 7B на одной 24GB GPU.
- Prompt tuning: Только soft prompts обучаются. Минимальные ресурсы, но ограниченное качество.
- PEFT methods: IA3, Prefix Tuning, P-Tuning. Альтернативы LoRA для специфических задач.
Для большинства задач QLoRA - оптимальный компромисс между требованиями к железу и качеством результата.