Meta تطلق التفريغ الصوتي الحي في نموذج واحد: Muse Voice Transcribe في المعاينة

يدمج Muse Voice Transcribe التعرف على الكلام في الوقت الفعلي ونسبة المتحدثين الحية في نموذج تدفق واحد؛ وهو في معاينة عامة على Meta Model API، موجهًا لمطورين لا يريدون بناء خط أنابيب.

Meta تطلق التفريغ الصوتي الحي في نموذج واحد: Muse Voice Transcribe في المعاينة

المعاناة الكلاسيكية لمطور يضيف ميزة كلام حي إلى منتجه هي خط أنابيب: نموذج يفرغ الصوت، وثان يفصل المتحدثين، وثالث يضيف الترقيم، وتتراكم تأخيراتها فوق بعضها. إعلان Meta عن Muse Voice Transcribe يستهدف هذه المعاناة مباشرة: تفريغ فوري ونسبة حية للمتحدثين مدمجان في نموذج تدفق واحد، متاح الآن في معاينة عامة على Meta Model API.

وأكملت Meta بطاقة هوية النموذج: Muse Voice Transcribe هو أول نموذج إدراك صوتي فوري من فريق Superintelligence Labs. وتجتمع القدرات في تدفق واحد: تعرف متدفق على الكلام، وفصل حواري لأكثر من 20 متحدثًا مع كشف نهايات الكلام؛ متعدد اللغات يتابع تبديل اللغة وسط الجملة بسلاسة، وترتفع دقته بتلميحات اللغة والكلمات المفتاحية والسياق. والقياس المستقل يدعم الادعاء: في مؤشر AA-WER المتدفق من Artificial Analysis يحتل النموذج المرتبة الأولى بنسبة خطأ 3.1 بالمئة، متقدمًا على Cartesia عند 3.4 وElevenLabs عند 3.6.

وادعاء Meta هو دقة تفريغ منافسة دون تجميع نماذج مساعدة ودون دفع أسعار مرتفعة. والترجمة العملية: منتجات مثل مساعدي الاجتماعات والترجمة النصية الحية وتحليلات مراكز الاتصال تحصل على جوابي "ماذا قيل" و"من قاله" من استدعاء واحد، فتسقط كلفة طبقة فصل المتحدثين المنفصلة وتأخيرها.

وللتموضع معناه أيضًا: مع فتح Meta واجهة Model API لمطوري المؤسسات عبر عائلة Muse، تحط على الرف نفسه مع خط Whisper لدى OpenAI وخدمات الكلام لدى غوغل. الصوت هو الواجهة الطبيعية لعصر الوكلاء؛ وحين يقرأ الخبر مع موجة الذكاء على الجهاز التي غطيناها هذا الأسبوع تتضح الصورة: التعرف على الكلام في طريقه من منتج منفصل إلى مدخل افتراضي لكل منتج.

Devamını oku