ستانفورد تنشر قياسًا يقيّم وكلاء الذكاء الاصطناعي في سير العمل العلمي

يضمّ الإصدار الأول من Terminal-Bench-Science سبعين مهمّة مأخوذة من أعمال أنجزها باحثون فعلًا. وفي النتائج الأولى ينجز أفضل وكيل 30 بالمئة منها.

ستانفورد تنشر قياسًا يقيّم وكلاء الذكاء الاصطناعي في سير العمل العلمي

نشر جهدٌ بقيادة جامعة ستانفورد قياس Terminal-Bench-Science الذي يقيّم وكلاء الذكاء الاصطناعي في سير عمل البحث العلمي بدل تطوير البرمجيات.

ويضمّ الإصدار الأول 70 مهمّة، كلٌّ منها مأخوذة من أعمال أنجزها باحثون ممارِسون. وفي النتائج الأولى يحلّ أفضل وكيل 30 بالمئة منها.

لقائمة المهامّ والمنهجية وجدول النتائج الكامل: إعلان Terminal-Bench ومستودع GitHub.