Ana içeriğe geç
Yapay Zeka

Nari Labs Qwen3-TTS modelinde ilk ses gecikmesini 50 milisaniyenin altına indirdi

Öne çıkanlar

  • Qwen3-TTS modeli tek NVIDIA H100 SXM üzerinde saniyede 10 istekte 50 milisaniyenin altında ilk ses üretti.
  • Talker, Code Predictor ve Codec modülleri bağımsız planlanabilir tek bir zamanlayıcı altında birleştirildi.
  • Tam kapasite kullanımda 1 milyon karakterlik ses sentezleme maliyeti yaklaşık 2 dolara geriledi.

Yapay zeka altyapı girişimi Nari Labs, açık kaynaklı Qwen3-TTS 1.7B CustomVoice modeli üzerinde yaptığı optimizasyonlarla ilk ses üretim süresini (TTFA) 50 milisaniyenin altına düşürdü. Tek bir NVIDIA H100 SXM grafik işlemcisi üzerinde saniyede 10 istek işleyen sistem, gerçek zamanlı ses akışını kesintisiz sürdürdü. Şirket, geliştirdiği özel sunucu mimarisini ve test altyapısını açık kaynak olarak yayımladı.

Ekip, Qwen3-TTS modelinin üç temel bileşeni olan Talker, Code Predictor ve Codec katmanlarını tek bir zamanlayıcı altında birleştirdi. Bu mimari sayesinde henüz ses üretmemiş yeni isteklere öncelik verilirken devam eden oturumlar oynatma tamponu sınırına göre planlandı. Sistem ayrıca baştaki sessizlik payını otomatik kırpma, CUDA grafları ve önbellek tabanlı aşamalı kod çözme yöntemleriyle donatıldı.

Gerçekleştirilen testler, sistemin 10 RPS yük altında saniyede yaklaşık 630 karakter üretebildiğini gösterdi. Bu performans, tam kapasitede 1 milyon karakter başına yaklaşık 2 dolarlık maliyet sağlıyor. Benzer ticari çözümler olan ElevenLabs V3 için bu maliyet 100 dolar, Cartesia Sonic 3.5 için ise 49 dolar seviyesinde bulunuyor.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.