ورقة بحثية من Anthropic: باحثون آليون يحسّنون المحاذاة في عشرة اختبارات

تفيد ورقة بحثية جديدة من Anthropic بأن أنظمة آلية حسّنت أداء نموذج في عشرة اختبارات محاذاة، بتكلفة نحو 4 دولارات في الساعة مقابل 150 دولارًا للباحث البشري.

ورقة بحثية من Anthropic: باحثون آليون يحسّنون المحاذاة في عشرة اختبارات

نشرت شركة Anthropic يوم الجمعة ورقة بحثية بعنوان "Automated Researchers Can Reliably Mitigate Alignment Failures"، تشرح كيف يمكن لأنظمة الذكاء الاصطناعي (AI) أن تحسّن أداء نموذج في اختبارات المحاذاة (alignment). وقاد العمل الباحث Chen Yueh-Han في برنامج الزملاء لدى الشركة، وتفيد الورقة بأن الأنظمة الآلية حسّنت الأداء في كل واحد من عشرة اختبارات مخصصة لسلوكيات غير محاذية، دون تراجع في الأداء العام.

كيف يعمل النظام

وفق الورقة، يحاكي النظام الآلي معظم خطوات البحث التقليدي: يبحث في الأدبيات المتاحة، يقترح منهجية، ثم يدرّب النموذج بها لمدة 30 دقيقة، مع رفع درجة الاختبار تدريجيًا عبر عدة تكرارات. تُحفظ الطرق الفعّالة ويُستبعد غير الفعّال، ما يتيح للنظام العمل بسرعة وعلى نطاق واسع.

وتقارن الورقة الباحث الآلي للمحاذاة (AAR) بنظيره البشري مباشرة، وتقول إن "أفضل منهجية للباحث الآلي تتجاوز ما يقترحه بشر ذوو خبرة، خلال ست ساعات في المتوسط"، وإن "اتجاهات البحث الموجّهة بشريًا لا تؤدي إلى أداء أقوى". وتضيف مقارنة للتكلفة: نحو 4 دولارات في الساعة لاستدلال واجهة البرمجة (API) مقابل 150 دولارًا في الساعة تدفعها الشركة لباحثيها البشريين.

القيود المذكورة

تسرد الورقة قيودًا أيضًا: النظام الآلي فعّال فقط بقدر ما تعكس الاختبارات أهداف المحاذاة الحقيقية، ويبقى بناء تلك الاختبارات وصيانتها عملاً كبيرًا، إلى جانب صيانة الأدبيات التي يستند إليها الباحثون الآليون وتوسيعها. ويصف الباحثون النتائج بأنها "دليل مبكر على أن التدريب اللاحق الآلي للمحاذاة قد يصبح عمليًا في المدى القريب".

التفاصيل الكاملة في تقرير TechCrunch.