Stanford
ستانفورد تنشر قياسًا يقيّم وكلاء الذكاء الاصطناعي في سير العمل العلمي
يضمّ الإصدار الأول من Terminal-Bench-Science سبعين مهمّة مأخوذة من أعمال أنجزها باحثون فعلًا. وفي النتائج الأولى ينجز أفضل وكيل 30 بالمئة منها.
Stanford
يضمّ الإصدار الأول من Terminal-Bench-Science سبعين مهمّة مأخوذة من أعمال أنجزها باحثون فعلًا. وفي النتائج الأولى ينجز أفضل وكيل 30 بالمئة منها.
Stanford
The first release of Terminal-Bench-Science contains 70 tasks drawn from work researchers actually performed. In the first results, the best agent completes 30 percent of them.
Stanford
Terminal-Bench-Science'ın ilk sürümünde, araştırmacıların gerçekten yaptığı işlerden alınmış 70 görev var. İlk sonuçlarda en iyi ajan görevlerin yüzde 30'unu bitirebiliyor.