Not

Sözlükten sesli asistana: ilk yazının ses eşlikçisi

Yolun ilk aşaması neyle bitti: konuşma tanımada kelime hata oranı %34,6'dan %17,0'a, koca bir roman — 16 bölüm, 15.444 kelime, 1 saat 58 dakika — sentezlenmiş bir sesle okundu, hepsi tek bir ev bilgisayarı ekran kartında. Burada dinleyebileceğiniz örnekler var.

◆ TTS◆ ASR◆ ses
Şafak öncesi Kırım yaylası. Serinin ilk yazısı da bu manzarayla başlamıştı.
Şafak öncesi Kırım yaylası. Serinin ilk yazısı da bu manzarayla başlamıştı.

Serinin ilk yazısı ana-yurt.com’da çıktı ve her şeyin nereden başladığını anlatıyor: Kırım Tatarcası için neredeyse hiçbir şey yok. «Az» değil — gerçekten neredeyse hiçbir şey. Makine çevirisi yok, konuşma tanıma yok, bir metni öylece dinlemeye yarayacak sentez yok. Dilin kendisi ise tehlikedeki diller listelerinde sayılıyor. Bu sayfa o yazının ses eşlikçisi: orada kelimelerle anlatılanları burada dinleyebilirsiniz.

Bundan doğan plan bugün bile fazla iddialı görünüyor: yolu baştan sona yürümek, sıradan bir sözlükten Kırım Tatarcasıyla konuşabileceğiniz bir sesli asistana kadar. Sözlük ve Kiril ile Latin alfabeleri arasındaki dönüştürme çoktan çalışıyor. Konuşma, sıradaki ve en ağır aşama oldu — ve çeviriciden önce gelmesinin iki nedeni var. Canlı konuşması hâlâ kaydedilebilecek insanlar gençleşmiyor: işin ertelenemeyecek tek parçası bu. Tanıma ile sentez de birbirini yukarı çekiyor — eski kayıtlar metne dönüşüyor, sesiyle birlikte duran metin bir ses için malzeme oluyor, ses sesli kitaplar yapıyor, o kitaplar dinleniyor, konuşma çoğalıyor.

Bu aşamanın sonunda elde ne var. Tanıma: başladığım model kelimelerin %34,6’sında yanılıyordu; ince ayardan sonra %20,1; modelin kod çözerken kelimeleri nasıl seçtiğini dikkatle ayarladıktan sonra %17,0. Hata yarıya indi, üstelik modele eklenen parçanın tamamı 126 megabayt. Sentez: ses koca bir kitabı okudu — Şamil Alâdin’in «Merdiven» romanını; gösteri için bir parça ya da tek bir bölüm değil, 16 bölümün tamamı — 15.444 kelime, 1 saat 58 dakika, her bölümde her kelimenin zamanlaması denetlenerek. Hepsi tek bir ev bilgisayarı ekran kartında, akşamları ve geceleri; spikerli bir stüdyo olmadan, sunucu çiftliği olmadan.

Ayrı bir hikâye de q sesi. Hazır bir Türkçe ses qara kelimesini «kara» diye okuyordu: Türkçede bizim /q/ sesimiz yok. Çözüm veri eklemek değil, temeli değiştirmek oldu: bu sesin bulunduğu ve kendi harfiyle yazıldığı dillerin — Kazakça, Uygurca, Başkurtça — arasında olduğu çok dilli bir temel aldım ve bizim къ, гъ, нъ harflerimizi onun tanıdığı ҡ, ғ, ң harflerine çevirdim. Doğru telaffuz daha ince ayar yapılmadan ortaya çıktı. Aşağıda bunu her gün söylediğimiz kelimelerde duyabilirsiniz.

Ses

Aşağıdakilerin hepsi, aksi söylenmedikçe, sentez. Ses Sevil’e ait, gösterim hakları onaylandı.

«Merdiven», bölümden bir parça

Sevil'in sesi. O 1 saat 58 dakikadan bir parça.

q, ğ, ñ sesli kelimeler

Modelin temelini değiştirmek zorunda bırakan ses.

Spiker ve model

Aynı üç cümle: önce canlı kayıt, sonra sentez. İki ayrı oynatıcı — yukarıdan aşağıya arka arkaya dinlemek daha iyi.

Spiker

Gerçek bir insan, derlemden bir stüdyo kaydı.

Model

Aynı metin, kendi modelimizin sentezi.

Başlangıç ve bugün

Herkese açık olarak yayımladığım ilk model SpeechT5’ti, Aralık 2025: Kırım Tatar Latin alfabesi İngilizce fonetiğine çevriliyordu (ğ→gh, ş→sh, ñ→ng), ses 16 kHz çıkıyordu. İki kaydın metinleri farklı — o ilk modeli tek tek kelimelerle sınıyordum, iş kelimelerden öteye gitmiyordu.

İlk model, Aralık 2025

SpeechT5, q, ğ, ñ sesli altı kelime — en başta kulağa böyle geliyordu.

Bugünkü model

Altı cümle, bugünkü model, aynı ses.

Devamını okuyun

Bu sayfa Rusça aslından çevrilmiştir.