Ana içeriğe geç
Yapay Zeka

Google Gemini 3.5 Transcribe modelini kullanıma sundu

Öne çıkanlar

  • Model, gerçek zamanlı akışta ortalama yüzde 4,0 kelime hata oranına ulaştı.
  • Gemini 3.5 Transcribe, 85’ten fazla dili otomatik olarak algılıyor.
  • Google, Chirp 3’e göre son transkripsiyon süresini yüzde 70 iyileştirdi.
  • Kayıtlı seslerde 3 konuşmacıya kadar zaman damgalı ayrım yapılıyor.

Google, ses kayıtlarını daha doğru ve düzenli metne dönüştürmek için geliştirdiği Gemini 3.5 Transcribe modelini tanıttı. Model, arka plan gürültüsü, teknik terimler ve konuşma sırasında yapılan düzeltmeler gibi sorunları işleyerek ham sesi biçimlendirilmiş metne çeviriyor. Geliştiriciler modelin gerçek zamanlı ve önceden kaydedilmiş ses işleme özelliklerine Gemini API, Google AI Studio ve Gemini Enterprise Agent Platform üzerinden erişebiliyor.

Gerçek zamanlı kullanımda Live API içindeki gemini-3.5-transcribe-live modeli, etkileşimli ses uygulamaları için çift yönlü akış ve saniyenin altında gecikme sunuyor. Interactions API içindeki gemini-3.5-transcribe ise toplantı, çağrı kaydı ve diğer ses dosyalarını konuşmacı ayrımı ve kelime düzeyinde zaman damgalarıyla yazıya döküyor. Model, 85’ten fazla dili otomatik olarak algılıyor, özel kelime listelerini tanıyor ve kayıtlı seslerde 3 konuşmacıya kadar ayrım yapıyor. 3’ten fazla konuşmacı desteği deneysel olarak sunuluyor.

Artificial Analysis ölçümlerine göre modelin ortalama kelime hata oranı gerçek zamanlı akışta yüzde 4,0, akış dışı kullanımda yüzde 2,6 oldu. Google, önceki Chirp 3 modeline kıyasla son transkripsiyona ulaşma süresinin yüzde 70 iyileştiğini belirtti. Gemini 3.5 Transcribe, Android’de Gboard içindeki Rambler özelliğinde, Gemini’nin macOS uygulamasında ve Google Antigravity’de kullanılıyor. Geliştiricilere açık ön izleme sunulurken Chrome desteği ileride yayımlanacak.

Kaynak

Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.