Для языка вроде нашего распознавание сложнее синтеза. Синтезу достаточно нескольких чистых голосов; распознаванию нужны много дикторов, много условий записи и вся диалектная вариативность живой речи.
Наша текущая доля ошибок в словах слишком высока для расшифровки совещаний, обращений и публичных документов — именно тех задач, к которым модель применили бы в первый же день. Опубликовать её сейчас — значит опубликовать модель, которая недослышит язык, а это подрывает доверие ко всему остальному, что мы выпускаем.
Поэтому работа снова о данных: анализ ошибок по группам дикторов и условиям записи, затем целевая запись там, где модель ошибается сильнее всего. Не модель побольше — покрытие получше.
Когда уровень ошибок станет достойным релиза, распознавание речи войдёт в тот же API, что и синтез. До тех пор эта страница — честный статус проекта.