Wispr gerçek ortam dikteleri için geliştirdiği konuşma modeli Canto'yu duyurdu
Öne çıkanlar
- Canto, 2 bin 300'den fazla konuşmacının yer aldığı gerçek kullanım testinde en düşük kelime hata oranını elde etti.
- Eğitimde aday metinleri karşılaştırarak ödüllendiren GRPO tabanlı pekiştirmeli öğrenme yöntemi kullanıldı.
- Model, LibriSpeech veri setinde en düşük hata payını yakalarken FLEURS ve Common Voice testlerinde rekabetçi kaldı.
- Wispr ekibi, deşifre ve konuşmacı ayrımını birleştirecek 10 kat daha büyük yeni bir modelin eğitimine başladı.
Wispr Advanced Interfaces Lab, gerçek zamanlı dikte işlemleri için özel olarak geliştirdiği yeni konuşma tanıma modeli Canto'yu tanıttı. Gürültülü ortamlarda ve mikrofon kalitesinin düştüğü anlarda çalışan model, 2 bin 300'den fazla kullanıcının 10 saatlik gerçek kullanım kayıtlarından oluşan test kümesinde en düşük kelime hata oranına (WER) ulaştı. Laboratuvar, modelin performansını Google, OpenAI, AssemblyAI ve Deepgram gibi sağlayıcıların çözümleriyle kıyasladı.
Eğitim sürecinde denetimli ince ayar (SFT) aşamasının ardından Grup Göreceli Politika Optimizasyonu (GRPO) tabanlı pekiştirmeli öğrenme uygulandı. Bu yöntem sayesinde modelin ürettiği tam metin adayları birbiriyle kıyaslanarak başarı puanlarına göre ödüllendirildi. Geliştiriciler ayrıca kullanıcıların yaptığı metin düzenlemelerinden hata sinyalleri çıkaran özel bir mekanizma kurarak bağlamsal sözlük verilerinin model tarafından ne zaman dikkate alınacağını da denetledi.
Zorlu ortamlar için hazırlanan üç saatlik ayrı test kümesinde Canto, gerçek zamanlı modeller arasında liderliği korurken genel sıralamada yalnızca yüksek gecikmeli Gemini 3.1 Pro modelinin gerisinde kaldı. Şirket, Canto'nun ilk adım olduğunu ve konuşmacı ayrımı (diarization) ile deşifreyi birleştiren, mevcut modelin 10 katı büyüklüğündeki yeni nesil mimarinin eğitimine başladığını duyurdu.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.