На сервер устанавливается transformers, diffusers, accelerate, datasets и tokenizers через pip без каких-либо ограничений. Драйверы NVIDIA и CUDA Toolkit ставятся стандартным способом и совместимы с любой версией PyTorch или TensorFlow. Hugging Face CLI работает через стандартный HTTP, что позволяет скачивать модели приватного и публичного репозитория с авторизацией через персональный токен. Никаких ограничений на исходящий траффик к huggingface.co не накладывается.
Для серьёзных проектов рекомендуется поднять собственный Hugging Face Hub зеркало через локальный кеш или использовать text-generation-inference и инфраструктурные образы для production. Поддерживается работа со всеми типами моделей: causal LM, masked LM, seq2seq, encoder, decoder, vision transformers, diffusion и audio. Также работают полные пайплайны через pipeline API, что упрощает быстрые эксперименты.