Tencent تنشر بهدوء نموذج EVIE للبحث في المستندات بصريًا
النموذج مفتوح المصدر بحجم 8.5 غيغابايت يبحث في الصفحة نفسها بدل تحويل ملفات PDF والجداول والمستندات الممسوحة إلى نص. يتفوّق على نماذج أكبر منه بمرّتين في ViDoRe ويعمل محليًا.
رفعت Tencent نموذج EVIE-Preview-4.5B للبحث البصري في المستندات إلى منصّة Hugging Face من دون إعلان. والنموذج منشور برخصة Apache 2.0، أي يمكن تنزيل أوزانه وتشغيله محليًا.
وليس النموذج مساعدًا حواريًا، بل مهمّته الاسترجاع: العثور على الصفحة التي تجيب عن سؤال ما داخل كمّ من المستندات. وما يميّزه أنه لا يحوّل الصفحة إلى نص أولًا، بل ينظر إلى الصفحة ذاتها بما فيها الرسوم والجداول والتخطيط والصور. وتقول Tencent إنه يبحث في الرسوم البيانية والجداول والتقارير العلمية والإيداعات المالية والنماذج الممسوحة ضوئيًا، وبعدّة لغات.
ومن الناحية التقنية، بُني النموذج فوق العمود الفقري البصري-اللغوي Qwen3.5-4B ويضمّ 4.54 مليار معامل، وحجم الملف بصيغة BF16 يبلغ 8.5 غيغابايت. وبدل المقاطع النصية ينتج متجهات متعدّدة بأبعاد 128 لكل صفحة.
ووفق الأرقام التي نشرتها الشركة، يحتلّ النموذج المركز الأول في ViDoRe V3 بنتيجة 65.36 على مقياس nDCG@10 مقابل 65.32 لصاحب المركز الثاني. وفي ViDoRe V1+V2 يتصدّر 14 مهمة بنتيجة 85.77 على مقياس nDCG@5 مقابل 84.90. وهذه الأرقام واردة في بطاقة النموذج نفسها ولم تخضع لتحقّق مستقلّ.
ويُحدث صِغر بُعد المتجهات فارقًا في التخزين. ففي المثال الذي تعطيه Tencent، يشغل الفهرس الخام لمليون صفحة 179.2 غيغابايت عند ميزانية 768 رمزًا للصفحة، و420.5 غيغابايت عند مستوى 1792 رمزًا.
للاطّلاع على بطاقة النموذج والأوزان: صفحة Hugging Face، وللشيفرة: مستودع GitHub.