Tavus'un Sparrow-2'si sesli yapay zekanın boru hattını söküyor: odayı da konuşmanın tamamını da dinliyor
Alışılmış sistem sesi temizleyip tek konuşmacıyı ayırıyor ve gerisini atıyor. Sparrow-2 bunun tersini yapıyor; şirket konuşma başarısızlık oranını yüzde 2,1 ölçtüğünü söylüyor.
Tavus, gerçek zamanlı konuşma anlama modeli Sparrow-2'yi yayına aldı. Model şirketin PAL adını verdiği görüntülü konuşan yapay zeka karakterlerini besliyor.
Sorunu anlamak için mevcut yöntemi bilmek gerekiyor. Sesli yapay zeka bugüne kadar işi şöyle kolaylaştırdı: ses etkinliği algılama konuşanı bulur, gürültü engelleme odayı siler, tek konuşmacı ayrıştırılır, metne çevrilir, bir zamanlayıcı cümlenin bittiğine karar verir. Her adımda bilgi atılıyor. Bir hı-hı gürültü sayılıyor, ikinci bir ses parazit oluyor, kalabalık bir oda tamamen kayboluyor.
Sparrow-2 bunun tersini yapıyor: akan sesten konuşmanın tamamını ve odanın tamamını sürekli modelliyor. Şirketin anlatımına göre bu iki şeyi açıyor. Birincisi, sesli yapay zekanın sessiz bir odaya ve temiz bir mikrofona ihtiyacı kalmıyor; kiosk, mağaza, kafe ve araç içi gibi ortamlar mümkün hale geliyor; literatürde kokteyl partisi problemi denen mesele bu. İkincisi sıra alma daha doğal oluyor: duraklamanın beklemek, hı-hı'nın devam et demek, anlaşılmayan konuşmanın tekrar sormak anlamına geldiğini ayırt ediyor.
Şirket rakam da veriyor: Sparrow-2'nin konuşma başarısızlık oranını yüzde 2,1 ölçmüşler, denedikleri en iyi alternatiften yaklaşık 4 kat düşük. Bu ölçüm Tavus'a ait; karşılaştırdığı sistemlerin adı verilmiyor ve bağımsız bir doğrulama yok.
Araştırma notu Tavus'un blogunda.