Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

أعلنت Inworld الإتاحة العامة لنموذج Realtime TTS-2 لتحويل النص إلى كلام، بزمن استجابة نحو 100 مللي ثانية ودعم هوية صوتية واحدة عبر أكثر من 200 لغة، إلى جانب إصدار TTS-2 Flash بزمن 25 مللي ثانية ونصف السعر.

Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة

أعلنت شركة Inworld في منشورها الرسمي إتاحة نموذج Realtime TTS-2 للاستخدام العام (GA)، وهو نموذج لتحويل النص إلى كلام (text to speech)، أي تقنية تحول النص المكتوب إلى صوت منطوق. وتقول الشركة إن زمن الوصول إلى أول بايت نحو 100 مللي ثانية، وإن هوية الصوت نفسها تنطق أكثر من 200 لغة دون أن تتغير. وتصف Inworld الإصدار بأنه أكبر قفزة في تاريخها، وتقول إنه صار الأول على منصة التقييم Artificial Analysis وأسرع نموذج في فئته، وهي ادعاءات صادرة عن الشركة ولم تؤكدها جهة مستقلة.

توجيه الصوت والأداء التمثيلي

أبرز ما في Realtime TTS-2 هو توجيه الصوت بلغة طبيعية (voice direction)؛ إذ تكتب التعليمة بين قوسين معقوفين قبل الجملة فتتغير طريقة الأداء دون تغيير النص. ففي المثال الذي نشرته الشركة تؤدى الجملة نفسها “I'm happy for you. Really.” بتعليمة [speak through gritted teeth, barely holding it in] فتخرج متوترة، وبتعليمة [speak warmly, like you mean every word] فتخرج دافئة. ويتيح النموذج أيضا استنساخ الأصوات الاحترافي ذاتيا دون وسيط، وتصميم الأصوات بالوصف اللغوي، ودعم السياق متعدد الأدوار (multi-turn context). وتقول الشركة إن الاستخدام الكثيف للنسخة التجريبية البحثية عاد إلى مرحلة البحث وأنتج نسخة اليوم.

السرعة والسعر ومنافذ الوصول

إلى جانب النسخة الأساسية صدر TTS-2 Flash، وتصفه Inworld بأنه أسرع نموذج لتحويل النص إلى كلام في العالم، بزمن 25 مللي ثانية حتى أول بايت وبنصف السعر، وتقول إنه يتقدم على نماذج تفوقه كلفة وتأخيرا بعشرين ضعفا، وهو موجه للتطبيقات التي تحسب فيها كل مللي ثانية. والسعر في الاشتراك 12.50 دولارا لكل مليون حرف، أي نحو 1.5 سنت للدقيقة. والنموذج متاح عبر inworld.ai وعبر شركاء منهم Cloudflare وLiveKit وTelnyx وTencent RTC وVoximplant. ووصفه ديفيد جاو، المدير التقني في LiveKit، في بيان الإطلاق بأنه خطوة حقيقية في تركيب الكلام المعبر عاطفيا. وتقول Inworld إن مئات الملايين يتفاعلون يوميا مع تطبيقات مبنية على النموذج في تعلم اللغات والرفقة والصحة والألعاب وخدمة العملاء. وفي 31 أغسطس فتحت الشركة مصدر عدة تقييم النطق لديها، قائلة إن تقييم هذه النماذج أقل معيارية مما يظن، وإن نموذج التعرف على الكلام المستخدم في القياس قد يغير معدل خطأ الكلمات بين فريقين يشغلان التجربة نفسها.

Devamını oku

Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 称 Realtime TTS-2 正式商用:首字节延迟约 100 毫秒,同一音色支持 200 多种语言,同日发布的 Flash 版本降至 25 毫秒

Inworld 于 9 月 2 日宣布文本转语音模型 Realtime TTS-2 正式商用(GA),并同步推出更快的 TTS-2 Flash。公司称前者首字节延迟约 100 毫秒、同一音色可跨 200 多种语言使用,订阅价为每百万字符 12.5 美元;后者延迟低至 25 毫秒,价格为其一半。模型已在 inworld.ai 上线,也可通过 LiveKit、Cloudflare 等平台调用。

GlobalFeed Editor tarafından
World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

World Labs发布Atlas:号称全球首个多模态世界模型,像素级相机控制生成1440p视频、稀疏图片重建3D,可为机器人生成模拟数据,未来数周开放早期访问

李飞飞创办的World Labs于9月1日发布多模态世界模型Atlas,官方称其为全球首个此类模型:可从一张或多张图片以像素级相机控制生成最长1分钟的1440p视频,从少量照片重建真实空间的3D结构,并为机器人生成RGB与深度模拟数据。公司自测在相机条件生成与3D重建基准上超过专用模型。目前仅向选定合作伙伴开放早期访问,未来几周扩大范围,未公布价格。

GlobalFeed Editor tarafından