Mockingbirdстатьи

Почему faster-whisper large-v3-turbo — оптимальная модель для интервью

Технологии·6 мин

Коротко: large-v3-turbo в составе faster-whisper даёт почти максимальную точность large-v3, но заметно быстрее — оптимальный баланс для реального времени. Меньшие модели уступают на технической лексике.

Что такое faster-whisper

Оптимизированная реализация Whisper на CTranslate2. Быстрее оригинала при том же качестве, умеет работать на GPU через CUDA. В Mockingbird распознавание выполняется локально.

Почему именно turbo

Сравнение моделей

МодельТочностьСкоростьКогда выбирать
tiny / baseнизкаяочень высокаятолько CPU
small / mediumсредняявысокаяслабый GPU
large-v3-turboвысокаявысокаяGPU с CUDA (рекомендовано)
large-v3максимальнаянижесильный GPU

Русский язык и термины

Whisper многоязычен и уверенно работает с русским. Технические термины крупные модели распознают точнее, а поверх работает фонетическая коррекция (например, «Zabix» → «Zabbix»).

Вывод

Если есть GPU — начинайте с large-v3-turbo. Не хватает ресурсов — опускайтесь по таблице. Инструкция — в документации.

Частые вопросы

Какая модель лучше для русского языка?

large-v3-turbo даёт хороший баланс. Для максимальной точности без ограничений по скорости — large-v3.

Сколько видеопамяти нужно?

Зависит от модели. Для large-v3-turbo желательно 6 ГБ и больше; при нехватке приложение переключится на CPU.

Можно ли запустить без видеокарты?

Да, но распознавание будет медленнее. Для быстрой работы рекомендуется GPU NVIDIA с CUDA.

Mockingbird — офлайн-помощник на собеседованиях: локальное распознавание речи, база знаний из резюме, ответы за 2–5 секунд. Установка занимает минуты.