До сих пор каракалпакский голос каждый проект должен был делать сам — и почти никто не делал. Инструменты доступности, системы оповещения, киоски и образовательный софт по умолчанию переходили на другой язык — или обходились вовсе без голоса.
Модель доступна как API на karakalpakvoice.uz. Она покрывает обычный синтез речи и клонирование голоса: конкретный голос можно воспроизвести по короткой эталонной записи — это важно для учреждений, которым нужен один и тот же голос во всех их сервисах.
Самым трудным была не модель. Самым трудным были данные. Записей каракалпакской речи пригодного качества и с пригодной лицензией в открытом виде почти не существовало, поэтому первые месяцы проекта прошли не в обучении моделей, а в записи, очистке и проверке данных вместе с носителями языка.
Распознавание речи — естественный следующий шаг, и оно уже в исследовании. Мы не опубликуем его, пока уровень ошибок не станет достаточно низким для реальной расшифровки, — почему, объясняем в отдельной заметке.