Whisper доступен в нескольких размерах от tiny до large-v3 и turbo. Маленькие модели tiny и base работают даже на CPU, но качество распознавания значительно ниже, особенно на сложных аудио и неанглийских языках. Medium и large модели требуют GPU с 8 до 16 ГБ VRAM для комфортной скорости. Large-v3 даёт наилучшее качество и поддерживает 99 языков с высокой точностью. Наши тарифы покрывают все размеры моделей.
Альтернативой оригинальному Whisper служит faster-whisper на основе CTranslate2, который работает в 4 до 10 раз быстрее при сопоставимом качестве и более низком потреблении VRAM. Также популярна WhisperX для точного word level alignment и diarization, что критично для генерации субтитров и расшифровки многоголосых записей. Все эти варианты разворачиваются через pip без сложной настройки.