Mockingbirddocs

Выбор STT-модели

Коротко: по умолчанию используется large-v3-turbo — оптимальный баланс точности и скорости на GPU. Если ресурсов мало, берите модель меньшего размера из таблицы ниже. Mockingbird распознаёт речь локально черезfaster-whisper, поэтому выбор модели влияет на точность, скорость и потребление видеопамяти.

Размер модели

Чем крупнее модель, тем точнее распознавание и тем больше ресурсов ей нужно. По умолчанию используется large-v3-turbo — оптимум качества и скорости на GPU.

МодельТочностьСкоростьКогда выбирать
tiny / baseнизкаяочень высокаятолько CPU, слабое железо
small / mediumсредняявысокаяCPU с запасом или слабый GPU
large-v3-turboвысокаявысокаяGPU с CUDA (рекомендовано)
large-v3максимальнаянижесильный GPU, важна точность

На что обратить внимание

Смена модели

Модель выбирается в настройках приложения. После смены первая загрузка может занять время — файлы модели скачиваются один раз и кешируются локально.

Начните с large-v3-turbo на GPU. Если не хватает ресурсов — опускайтесь по таблице до комфортной скорости.