Inworld TTS-2 herkese açıldı: 100 ms'de ilk ses, 200'ü aşkın dilde aynı ses kimliği
Inworld, Realtime TTS-2'yi genel kullanıma açtı. Şirkete göre model ilk sesi yaklaşık 100 milisaniyede veriyor, aynı ses kimliğini 200'den fazla dilde koruyor. 25 milisaniyelik Flash sürümü de aynı gün çıktı.
Inworld AI, gerçek zamanlı metin okuma modeli Realtime TTS-2'yi 2 Eylül'de genel kullanıma açtığını resmi duyurusunda bildirdi. TTS, yazılı metni sese çeviren teknolojinin adı. Şirkete göre model ilk sesi yaklaşık 100 milisaniyede veriyor ve aynı ses kimliği 200'den fazla dilde korunuyor. Inworld aynı gün, ilk bayt süresi 25 milisaniye olan ve şirketin dünyanın en hızlı metin okuma modeli diye tanıttığı TTS-2 Flash'ı da yayınladı.
Ses yönetimi ve oyunculuk
Modelin öne çıkan özelliği, sesin doğal dille yönetilmesi. Kullanıcı köşeli parantez içinde talimat yazıyor, model tonu ona göre kuruyor. Duyuruda aynı cümlenin iki okuması örnek verildi: “[speak through gritted teeth, barely holding it in] I'm happy for you. Really.” (dişlerini sıkarak, zor tutarak: Senin adına sevindim. Gerçekten.) ile “[speak warmly, like you mean every word] I'm happy for you. Really.” (içten, her kelimesine inanarak söylenen aynı cümle). Metin aynı, oyunculuk farklı. Model ayrıca kendi kendine profesyonel ses klonlama, doğal dille ses tasarımı ve çok turlu bağlam takibi sunuyor. LiveKit'in teknoloji direktörü David Zhao, resmi duyuruda modeli “duygusal olarak ifade gücü yüksek ses sentezinde gerçek bir ileri adım” diye niteledi.
Hız, fiyat ve erişim
Inworld, araştırma önizlemesinin beklenenden çok daha fazla kullanıldığını, o deneyimin araştırmaya geri döndüğünü ve bugünkü sürümün şirket tarihindeki en büyük sıçrama olduğunu söylüyor. Şirket modelini Artificial Analysis sıralamasında birinci ve sınıfının en hızlısı olarak tanıtıyor; bu ifadeler şirketin kendi iddiası. Fiyat tarafında abonelikte 1 milyon karakter başına 12,50 dolar, yani dakikası 1,5 sent. Flash sürümü bunun yarısı fiyata çalışıyor. Şirkete göre yüz milyonlarca insan her gün bu modelin üzerine kurulu uygulamalarla etkileşime giriyor; dil öğrenme, özel ders, arkadaş ve rol yapma, sağlık, fitness, haber, oyun ve müşteri deneyimi uygulamaları bunların başında. Model inworld.ai üzerinden canlı; AudioStack, Cloudflare, DeepInfra, GMI Cloud, LiveKit, Mastra, Pipecat, Runware, Stream, Telnyx, Tencent RTC, VoiceRun ve Voximplant üzerinden de erişilebiliyor. Şirketin ML/AI araştırma başkanı 31 Ağustos'ta TTS değerlendirme takımını açık kaynak yapmış, gerekçe olarak aynı modeli aynı veri kümesinde çalıştıran iki ekibin farklı kelime hata oranı bildirebildiğini göstermişti.