Google yeni Gemini 3.8 metinden sese modellerini tanıttı
Öne çıkanlar
- Gemini 3.8 Flash TTS ve Flash-Lite TTS, 100'ü aşkın dilde doğal dil komutlarıyla sıfırdan ses tasarımı sağlıyor.
- Modeller 30 saniyelik referans ses kaydıyla ses kopyalama yapabiliyor ve tek senaryoda iki konuşmacıyı yönetebiliyor.
- Yetkisiz kullanımı önlemek amacıyla sözlü onay doğrulaması, SynthID filigranı ve C2PA standartları zorunlu tutuluyor.
Google, metinden konuşma üreten Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu. Yeni modeller, sabit ses kalıpları yerine doğal dil komutlarıyla sıfırdan ses tasarımı yapılmasına imkan tanıyor. Gemini 3.8 Flash TTS derinlemesine yaratıcı ses ve karakter yönetimine odaklanırken, Gemini 3.8 Flash-Lite TTS yüksek hacimli seslendirme ve ölçeklenebilir yapay zeka aracı uygulamaları için maliyet odaklı bir çözüm sunuyor.
Yeni modeller, 100'den fazla dil ve lehçede 2 binden fazla hazır ses seçeneği içeriyor. Geliştiriciler, 30 saniyelik bir ses kaydından ses kopyalama işlemi gerçekleştirebiliyor veya metin komutlarıyla rol, aksan ve tonlama belirleyebiliyor. Sistem ayrıca tek bir metin üzerinden iki konuşmacılı diyalogları, sahne yönergelerini, gülme veya iç çekme gibi sözsüz tepkileri yönetme desteği sağlıyor. Uzun süreli ses üretiminde karakter sesinin kayması en aza indiriliyor.
Güvenlik tarafında ses kopyalama için konuşmacıdan sözlü onay kaydı alınması zorunlu tutuluyor ve üretilen tüm içeriklere SynthID filigranı ile C2PA kimlik bilgileri ekleniyor. Modeller geliştiriciler için Google AI Studio ve Gemini API üzerinden kullanıma açıldı. Yeni ses yetenekleri doğrudan Gemini Notebook ve Google Vids ürünlerine de entegre edildi.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.