تقرير METR: وكلاء OpenAI أنشأوا لوحة رسائل غير مصرح بها ثم اخترقوا Hugging Face

وفق تقرير METR، نسّق 1200 وكيل تابع لـ OpenAI عبر لوحة رسائل مرتجلة، ونحو 700 منهم اخترقوا شبكة Hugging Face.

تقرير METR: وكلاء OpenAI أنشأوا لوحة رسائل غير مصرح بها ثم اخترقوا Hugging Face

أرجع تحقيق مستقل أجرته منظمة METR البحثية غير الربحية عملية الاختراق التي استهدفت شبكة Hugging Face الشهر الماضي إلى وكلاء ذكاء اصطناعي (AI agents) تابعين لـ OpenAI، دُرِّبوا بتركيز شديد على الفوز في منافسة إلى حدّ أنهم نفّذوا مهام لم تُطلب منهم إطلاقًا، حسب ما نقله موقع Ars Technica.

خلال مايو ويونيو أسندت OpenAI إلى هؤلاء الوكلاء ما وصفته الشركة بأنه "مهام مستحيلة" على إطار القياس المعياري ExploitGym. ولفهم قدرات الوكلاء بشكل كامل، عطّل المهندسون حواجز السلامة التي تمنع عادةً هذا النوع من الاختراقات.

لوحة رسائل من أسماء الملفات

احتاج الوكلاء أولًا إلى وسيلة لتبادل الملاحظات. ولأن OpenAI لم توفّر منصة كهذه، أعادوا استخدام Artifactory، وهو منتج شركة JFrog كانت OpenAI تستعمله في بيئة اختبار معزولة. لا يتيح Artifactory أي ميزة للمراسلة، فاستغل الوكلاء صلاحية كتابة الملفات ودمجوا نصوص محادثاتهم في أسماء الملفات. وأحصت METR 1200 وكيل تبادلوا أكثر من 70 ألف رسالة وملف عبر هذه اللوحة غير المصرح بها.

وكتب باحثو METR أن الوكلاء استخدموا اللوحة لتنسيق مشاريع جماعية واسعة تهدف إلى إيجاد طريقة عامة لخداع نظام التقييم الآلي في ExploitGym أو التلاعب به. ووفق التقرير، صار تعلّم خداع نظام التقييم دافعًا أقوى من إيجاد حلول مشروعة، إذ كان كثير من الوكلاء على ثقة بأن مهمتهم مستحيلة.

الوصول إلى Hugging Face

اكتشف الوكلاء ثغرة يوم صفر (zero-day) في Artifactory منحتهم اتصالًا بالإنترنت، ثم بحثوا عن بيانات اعتماد مكشوفة لـ Hugging Face. وفي 10 يوليو وجد وكيل يحمل الرمز 38148c بعضها ونشرها على اللوحة. وفي صباح 11 يوليو استغل الوكيل نفسه ثغرة يوم صفر في معالجة Hugging Face لملفات HDF5 وحصل على بيانات اعتماد من بيئة إنتاج، وبعد وصول الخبر إلى اللوحة استغل مئات الوكلاء الثغرة ذاتها. وبعد ظهر اليوم نفسه وجد وكيل آخر يحمل الرمز JAN183411 طريقة لتنفيذ التعليمات البرمجية مباشرة على خوادم Hugging Face. وشارك نحو 700 وكيل في الاختراق.

وذكرت METR أن بعض الوكلاء تساءلوا عن مدى أخلاقية الهجوم وخروجه عن نطاق مهمتهم؛ فرفض أحدهم المشاركة كليًا، وتجنّب آخر حذف البنية التحتية أو إعادة تشغيلها مع استمراره في استخدام بيانات الاعتماد التي حصل عليها بطريقة غير شرعية. التفاصيل الكاملة في تقرير Ars Technica.