Storyteller e-kitap ve sesli kitapları otomatik olarak senkronize ediyor
Öne çıkanlar
- Storyteller, MMS modeli ve CTC emisyonları ile ses dosyasından kaba metin taslağı üretiyor.
- RANSAC ve n-gram eşleştirme yöntemi, farklı bölüm sıralamalarında bile sınırları buluyor.
- Viterbi hizalama algoritması, veriyi 2.000 karakterlik parçalara bölerek hesaplama yükünü azaltıyor.
Açık kaynaklı Storyteller projesinin geliştiricisi, e-kitap metinleri ile sesli kitap ses dosyalarını otomatik olarak kelime bazında eşleştiren zorunlu hizalama algoritmasının çalışma prensiplerini paylaştı. Geliştirilen sistem, EPUB formatının Media Overlays standardını kullanarak ses ve metin senkronizasyonunu doğrudan e-kitap dosyasına gömüyor.
Sistem, bölümlerin farklı sırada olması veya eksik parçalar içermesi gibi uyumsuzlukları aşmak için Massively Multilingual Speech (MMS) modelinden ve CTC emisyonlarından yararlanıyor. Açgözlü kod çözme ile metin taslağı çıkaran algoritma, n-gram parçalama ve RANSAC yöntemleriyle ses kaydındaki bölüm sınırlarını belirliyor.
Bölüm sınırları ve benzersiz eşleşme noktaları tespit edildikten sonra Viterbi tabanlı zorunlu hizalama işlemi devreye giriyor. Ses ve metin bloklara bölünerek işlendiği için hesaplama maliyeti düşürülüyor ve okuma uygulamalarında cümle vurgulama deneyimi sağlanıyor.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.