نموذج Sonic-3.6 من Cartesia يتصدّر لوحتَي Artificial Analysis للصوت
الشركة تقول إنها توقّفت عن ضبط النهج القائم وأعادت البناء من المعمارية. النموذج يتصدّر لوحتَي صوت المزوّد والصوت المضبوط، لكنه في مرحلة بيتا وعبر واجهة Cartesia فقط.
أتاحت شركة تقنيات الصوت Cartesia نموذجها Sonic-3.6 لتحويل النصّ إلى كلام للاستخدام العام. وتقول الشركة إنها قرّرت في كانون الثاني/يناير التوقّف عن الضبط الدقيق للنهج القائم وإعادة البناء انطلاقًا من المعمارية، وإنها تجاوزت أفضل نماذجها خلال شهرين.
وفي ساحة الكلام لدى جهة التقييم المستقلّة Artificial Analysis، يحتلّ النموذج المركز الأول في اللوحتين. ففي لوحة "صوت المزوّد" يسجّل 1286 نقطة إيلو متقدّمًا على Simba 3.2 من Speechify (1238) وQwen-Audio-3.0-TTS-Plus من Alibaba (1237). وفي لوحة "الصوت المضبوط" يسجّل 1144 متقدّمًا على Sonic 3.5 من Cartesia نفسها (1099) وEleven v3 من ElevenLabs (1060). وهذه الترتيبات تُحدَّث مباشرةً وقد تتغيّر النقاط.
ويكمن الفارق التقني في المعمارية: إذ تستخدم Cartesia نماذج فضاء الحالة بدل المحوّلات (transformers). وبحسب رقم الشركة، يقلّ زمن الوصول إلى أول صوت عن 90 ميلي ثانية. ويدعم النموذج أكثر من 40 لغة.
وثمّة تفصيل يخصّ الإتاحة: فـSonic-3.6 حاليًا في مرحلة بيتا ومتاح عبر واجهة Cartesia البرمجية وحدها. ولا تزال وثائق الشركة تُدرج Sonic 3.5 بوصفه الإصدار المستقرّ، كما أن الشركاء يعتمدون 3.5. ويُقدَّم النموذج خدمةً مستضافة، ولا يمكن تنزيل أوزانه.
للتفاصيل: مدوّنة Cartesia وصفحة Artificial Analysis.