Запись
От словаря до голосового ассистента: звуковой спутник первой статьи
Чем закончился первый этап пути: распознавание речи с 34,6 % до 17,0 % ошибок, целый роман — 16 глав, 15 444 слов, 1 час 58 минут — прочитанный синтезированным голосом, и всё это на одной домашней видеокарте. Здесь — примеры, которые можно послушать.
Первая статья серии вышла на ana-yurt.com, и она про то, с чего всё началось: для крымскотатарского языка почти ничего нет. Не «мало» — именно почти ничего. Нет машинного перевода, нет распознавания речи, нет синтеза, чтобы текст можно было просто послушать. А сам язык при этом числится в списках исчезающих. Эта страница — звуковой спутник той статьи: здесь можно послушать то, о чём там рассказано словами.
План, который из этого вырос, выглядит самонадеянно даже сейчас: пройти путь целиком, от обычного словаря до голосового ассистента, с которым можно будет поговорить по-крымскотатарски. Словарь и перевод между кириллицей и латиницей уже работают. Речь оказалась следующим и самым тяжёлым этапом — и она пошла раньше переводчика по двум причинам. Люди, чью живую речь ещё можно записать, не молодеют: это единственная часть задачи, которую нельзя отложить. А распознавание и синтез раскручивают друг друга — старые записи становятся текстом, текст вместе со звуком становится материалом для голоса, голос делает аудиокниги, их слушают, речи становится больше.
Что есть по итогам этого этапа. Распознавание: модель, с которой я начинал, ошибалась в 34,6 % слов; после дообучения — 20,1 %; после аккуратной настройки того, как модель подбирает слова при расшифровке, — 17,0 %. Вдвое меньше ошибок, и весь довесок к модели весит 126 мегабайт. Синтез: голос прочитал целую книгу — роман Şamil Alâdin «Merdiven», не отрывок и не одну главу для демонстрации, а все 16 глав — 15 444 слов, 1 час 58 минут звучания, с проверкой таймингов по каждому слову в каждой главе. Всё это — на одной домашней видеокарте, вечерами и ночами, без студии с дикторами и без серверной фермы.
Отдельная история — звук къ. Готовый турецкий голос читал qara как «кара»: в турецком нашего /q/
просто нет. Помогла не добавка данных, а смена фундамента: я взял многоязычную основу, обученную в
том числе на казахском, уйгурском и башкирском — языках, где этот звук есть и записывается
собственной буквой, — и переписал наши къ, гъ, нъ в знакомые ей ҡ, ғ, ң. Правильное произношение
появилось ещё до дообучения. Ниже это слышно на словах, которые мы произносим каждый день.
Аудио
Всё, что ниже, — синтез, если не сказано иначе. Голос — Sevil, права на демонстрацию подтверждены.
«Мердивен», фрагмент главы
Слова с къ, гъ, нъ
Диктор и модель
Одни и те же три предложения: сначала живая запись, потом синтез. Два отдельных плеера — слушать лучше подряд, сверху вниз.
Диктор
Модель
С чего начиналось и что сейчас
Первая модель, которую я выложил публично, — SpeechT5, декабрь 2025 года: крымскотатарская латиница переписывалась в английскую фонетику (ğ→gh, ş→sh, ñ→ng), звук выходил на 16 кГц. Тексты у двух записей разные — ту первую модель я проверял отдельными словами, дальше слов дело не шло.
Первая модель, декабрь 2025
Сегодняшняя модель
Читать дальше
- Полная статья на ana-yurt.com (RU)
- Medium (EN) — My Language Is Listed as Endangered. So I Built It a Voice.
- dev.to (EN) — What I learned building speech tech for a language with zero datasets
- Hugging Face blog (EN) — Speech tech for a zero-dataset language: what actually consumed the time
- Хабр (RU) — инженерная версия: четыре решения, разборы ошибок и честные цифры
- LinkedIn (EN) — Giving an endangered language a voice, on one GPU