Выбор STT-модели
Коротко: по умолчанию используется large-v3-turbo — оптимальный баланс точности и скорости на GPU. Если ресурсов мало, берите модель меньшего размера из таблицы ниже. Mockingbird распознаёт речь локально черезfaster-whisper, поэтому выбор модели влияет на точность, скорость и потребление видеопамяти.
Размер модели
Чем крупнее модель, тем точнее распознавание и тем больше ресурсов ей нужно. По умолчанию используется large-v3-turbo — оптимум качества и скорости на GPU.
| Модель | Точность | Скорость | Когда выбирать |
|---|---|---|---|
tiny / base | низкая | очень высокая | только CPU, слабое железо |
small / medium | средняя | высокая | CPU с запасом или слабый GPU |
large-v3-turbo | высокая | высокая | GPU с CUDA (рекомендовано) |
large-v3 | максимальная | ниже | сильный GPU, важна точность |
На что обратить внимание
- GPU или CPU. Большие модели на CPU работают медленно — индикатор в тулбаре покажет
CPU, если CUDA недоступна. - Язык. Для русского выбирайте модели, где он поддерживается; Whisper многоязычен, но качество зависит от объёма обучающих данных по языку.
- Термины. Технический жаргон и аббревиатуры распознаются лучше крупными моделями; фонетическая коррекция терминов работает поверх любой модели.
- Задержка. Меньшая модель — ниже задержка от конца вопроса до ответа.
- Память. Проверьте, что свободной видеопамяти хватает под выбранный размер.
Смена модели
Модель выбирается в настройках приложения. После смены первая загрузка может занять время — файлы модели скачиваются один раз и кешируются локально.
Начните с large-v3-turbo на GPU. Если не хватает ресурсов — опускайтесь по таблице до комфортной скорости.