Gemini 3.5 Transcribe من Google يحوّل الكلام إلى نص بأكثر من 85 لغة
نموذج التعرّف على الكلام الجديد يحذف كلمات الحشو، ويتابع تصحيحات المتحدّث لنفسه، وينسّق النص تلقائيًا. وتذكر Google معدّل خطأ في الكلمات يبلغ 4.0% في البثّ المباشر و2.6% في الصوت المسجّل.
أعلنت Google عن Gemini 3.5 Transcribe، نموذجها الجديد لتحويل الكلام إلى نص. وتقدّمه الشركة بوصفه أدقّ نماذجها في التعرّف على الكلام حتى الآن، وتقول إنه يتعرّف تلقائيًا على أكثر من 85 لغة.
وما يميّزه أنه يتجاوز النسخ الحرفي. فبحسب Google، يحذف كلمات الحشو مثل "أم" و"آه"، ويتابع المتحدّث حين يصحّح نفسه في منتصف الجملة، وينسّق النص من تلقاء نفسه. والهدف تدوين المقصود لا نسخ الكلام حرفًا بحرف.
وفي الأرقام التي شاركتها الشركة، يبلغ معدّل الخطأ في الكلمات 4.0% في البثّ المباشر و2.6% في الصوت المسجّل. كما تقول Google إن زمن الاستجابة انخفض بنسبة 70% مقارنة بنموذجها السابق Chirp 3. وهذه قياسات الشركة نفسها، ولا تتوفّر بعد مقارنة مستقلّة.
ويأتي النموذج بواجهتين: واجهة Live API للبثّ المباشر بزمن استجابة منخفض جدًا (gemini-3.5-transcribe-live)، وواجهة Interactions API لمعالجة الصوت المسجّل مع تمييز المتحدّثين والطوابع الزمنية (gemini-3.5-transcribe). ويستطيع النموذج، عبر استدعاء الدوال، تسليم مهام مثل توليد الصور أو البحث في الويب إلى نماذج Gemini أخرى.
ويتوفّر Gemini 3.5 Transcribe عبر Google AI Studio ومنصة Gemini Enterprise Agent Platform. كما يشغّل ميزة "Rambler" في Gboard على أندرويد وتطبيق Gemini على macOS، مع دعم متوقّع قريبًا في Chrome.
للتفاصيل: إعلان Google.