Inworld TTS-2 herkese açıldı: 100 ms'de ilk ses, 200'ü aşkın dilde aynı ses kimliği

Inworld, Realtime TTS-2'yi genel kullanıma açtı. Şirkete göre model ilk sesi yaklaşık 100 milisaniyede veriyor, aynı ses kimliğini 200'den fazla dilde koruyor. 25 milisaniyelik Flash sürümü de aynı gün çıktı.

Paylaş
Inworld TTS-2 herkese açıldı: 100 ms'de ilk ses, 200'ü aşkın dilde aynı ses kimliği

Inworld AI, gerçek zamanlı metin okuma modeli Realtime TTS-2'yi 2 Eylül'de genel kullanıma açtığını resmi duyurusunda bildirdi. TTS, yazılı metni sese çeviren teknolojinin adı. Şirkete göre model ilk sesi yaklaşık 100 milisaniyede veriyor ve aynı ses kimliği 200'den fazla dilde korunuyor. Inworld aynı gün, ilk bayt süresi 25 milisaniye olan ve şirketin dünyanın en hızlı metin okuma modeli diye tanıttığı TTS-2 Flash'ı da yayınladı.

Ses yönetimi ve oyunculuk

Modelin öne çıkan özelliği, sesin doğal dille yönetilmesi. Kullanıcı köşeli parantez içinde talimat yazıyor, model tonu ona göre kuruyor. Duyuruda aynı cümlenin iki okuması örnek verildi: “[speak through gritted teeth, barely holding it in] I'm happy for you. Really.” (dişlerini sıkarak, zor tutarak: Senin adına sevindim. Gerçekten.) ile “[speak warmly, like you mean every word] I'm happy for you. Really.” (içten, her kelimesine inanarak söylenen aynı cümle). Metin aynı, oyunculuk farklı. Model ayrıca kendi kendine profesyonel ses klonlama, doğal dille ses tasarımı ve çok turlu bağlam takibi sunuyor. LiveKit'in teknoloji direktörü David Zhao, resmi duyuruda modeli “duygusal olarak ifade gücü yüksek ses sentezinde gerçek bir ileri adım” diye niteledi.

Hız, fiyat ve erişim

Inworld, araştırma önizlemesinin beklenenden çok daha fazla kullanıldığını, o deneyimin araştırmaya geri döndüğünü ve bugünkü sürümün şirket tarihindeki en büyük sıçrama olduğunu söylüyor. Şirket modelini Artificial Analysis sıralamasında birinci ve sınıfının en hızlısı olarak tanıtıyor; bu ifadeler şirketin kendi iddiası. Fiyat tarafında abonelikte 1 milyon karakter başına 12,50 dolar, yani dakikası 1,5 sent. Flash sürümü bunun yarısı fiyata çalışıyor. Şirkete göre yüz milyonlarca insan her gün bu modelin üzerine kurulu uygulamalarla etkileşime giriyor; dil öğrenme, özel ders, arkadaş ve rol yapma, sağlık, fitness, haber, oyun ve müşteri deneyimi uygulamaları bunların başında. Model inworld.ai üzerinden canlı; AudioStack, Cloudflare, DeepInfra, GMI Cloud, LiveKit, Mastra, Pipecat, Runware, Stream, Telnyx, Tencent RTC, VoiceRun ve Voximplant üzerinden de erişilebiliyor. Şirketin ML/AI araştırma başkanı 31 Ağustos'ta TTS değerlendirme takımını açık kaynak yapmış, gerekçe olarak aynı modeli aynı veri kümesinde çalıştıran iki ekibin farklı kelime hata oranı bildirebildiğini göstermişti.

Devamını oku

Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 于 9 月 2 日宣布文本转语音模型 Realtime TTS-2 正式商用(GA),并同步推出更快的 TTS-2 Flash。公司称前者首字节延迟约 100 毫秒、同一音色可跨 200 多种语言使用,订阅价为每百万字符 12.5 美元;后者延迟低至 25 毫秒,价格为其一半。模型已在 inworld.ai 上线,也可通过 LiveKit、Cloudflare 等平台调用。

GlobalFeed Editor tarafından
Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

أعلنت Inworld الإتاحة العامة لنموذج Realtime TTS-2 لتحويل النص إلى كلام، بزمن استجابة نحو 100 مللي ثانية ودعم هوية صوتية واحدة عبر أكثر من 200 لغة، إلى جانب إصدار TTS-2 Flash بزمن 25 مللي ثانية ونصف السعر.

GlobalFeed Editor tarafından
World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

李飞飞创办的World Labs于9月1日发布多模态世界模型Atlas,官方称其为全球首个此类模型:可从一张或多张图片以像素级相机控制生成最长1分钟的1440p视频,从少量照片重建真实空间的3D结构,并为机器人生成RGB与深度模拟数据。公司自测在相机条件生成与3D重建基准上超过专用模型。目前仅向选定合作伙伴开放早期访问,未来几周扩大范围,未公布价格。

GlobalFeed Editor tarafından