Партнёрство
Все новости

Почему мы пока не запускаем распознавание каракалпакской речи

Модель работает. Но недостаточно хорошо для задач, к которым её применили бы сразу, поэтому она остаётся в исследовании.

Для языка вроде нашего распознавание сложнее синтеза. Синтезу достаточно нескольких чистых голосов; распознаванию нужны много дикторов, много условий записи и вся диалектная вариативность живой речи.

Наша текущая доля ошибок в словах слишком высока для расшифровки совещаний, обращений и публичных документов — именно тех задач, к которым модель применили бы в первый же день. Опубликовать её сейчас — значит опубликовать модель, которая недослышит язык, а это подрывает доверие ко всему остальному, что мы выпускаем.

Поэтому работа снова о данных: анализ ошибок по группам дикторов и условиям записи, затем целевая запись там, где модель ошибается сильнее всего. Не модель побольше — покрытие получше.

Когда уровень ошибок станет достойным релиза, распознавание речи войдёт в тот же API, что и синтез. До тех пор эта страница — честный статус проекта.

Ещё из центра