Inworld تطلق Realtime TTS-2 رسميا: 100 مللي ثانية وهوية صوت واحدة في أكثر من 200 لغة
أعلنت Inworld الإتاحة العامة لنموذج Realtime TTS-2 لتحويل النص إلى كلام، بزمن استجابة نحو 100 مللي ثانية ودعم هوية صوتية واحدة عبر أكثر من 200 لغة، إلى جانب إصدار TTS-2 Flash بزمن 25 مللي ثانية ونصف السعر.
أعلنت شركة Inworld في منشورها الرسمي إتاحة نموذج Realtime TTS-2 للاستخدام العام (GA)، وهو نموذج لتحويل النص إلى كلام (text to speech)، أي تقنية تحول النص المكتوب إلى صوت منطوق. وتقول الشركة إن زمن الوصول إلى أول بايت نحو 100 مللي ثانية، وإن هوية الصوت نفسها تنطق أكثر من 200 لغة دون أن تتغير. وتصف Inworld الإصدار بأنه أكبر قفزة في تاريخها، وتقول إنه صار الأول على منصة التقييم Artificial Analysis وأسرع نموذج في فئته، وهي ادعاءات صادرة عن الشركة ولم تؤكدها جهة مستقلة.
توجيه الصوت والأداء التمثيلي
أبرز ما في Realtime TTS-2 هو توجيه الصوت بلغة طبيعية (voice direction)؛ إذ تكتب التعليمة بين قوسين معقوفين قبل الجملة فتتغير طريقة الأداء دون تغيير النص. ففي المثال الذي نشرته الشركة تؤدى الجملة نفسها “I'm happy for you. Really.” بتعليمة [speak through gritted teeth, barely holding it in] فتخرج متوترة، وبتعليمة [speak warmly, like you mean every word] فتخرج دافئة. ويتيح النموذج أيضا استنساخ الأصوات الاحترافي ذاتيا دون وسيط، وتصميم الأصوات بالوصف اللغوي، ودعم السياق متعدد الأدوار (multi-turn context). وتقول الشركة إن الاستخدام الكثيف للنسخة التجريبية البحثية عاد إلى مرحلة البحث وأنتج نسخة اليوم.
السرعة والسعر ومنافذ الوصول
إلى جانب النسخة الأساسية صدر TTS-2 Flash، وتصفه Inworld بأنه أسرع نموذج لتحويل النص إلى كلام في العالم، بزمن 25 مللي ثانية حتى أول بايت وبنصف السعر، وتقول إنه يتقدم على نماذج تفوقه كلفة وتأخيرا بعشرين ضعفا، وهو موجه للتطبيقات التي تحسب فيها كل مللي ثانية. والسعر في الاشتراك 12.50 دولارا لكل مليون حرف، أي نحو 1.5 سنت للدقيقة. والنموذج متاح عبر inworld.ai وعبر شركاء منهم Cloudflare وLiveKit وTelnyx وTencent RTC وVoximplant. ووصفه ديفيد جاو، المدير التقني في LiveKit، في بيان الإطلاق بأنه خطوة حقيقية في تركيب الكلام المعبر عاطفيا. وتقول Inworld إن مئات الملايين يتفاعلون يوميا مع تطبيقات مبنية على النموذج في تعلم اللغات والرفقة والصحة والألعاب وخدمة العملاء. وفي 31 أغسطس فتحت الشركة مصدر عدة تقييم النطق لديها، قائلة إن تقييم هذه النماذج أقل معيارية مما يظن، وإن نموذج التعرف على الكلام المستخدم في القياس قد يغير معدل خطأ الكلمات بين فريقين يشغلان التجربة نفسها.