Stanford, yapay zeka ajanlarını bilimsel iş akışlarında ölçen bir kıyaslama yayımladı
Terminal-Bench-Science'ın ilk sürümünde, araştırmacıların gerçekten yaptığı işlerden alınmış 70 görev var. İlk sonuçlarda en iyi ajan görevlerin yüzde 30'unu bitirebiliyor.
Stanford öncülüğündeki bir çalışma, yapay zeka ajanlarını yazılım geliştirme yerine bilimsel araştırma iş akışlarında ölçen Terminal-Bench-Science kıyaslamasını yayımladı.
İlk sürümde 70 görev var; hepsi çalışan araştırmacıların gerçekten yaptığı işlerden alınmış. İlk sonuçlarda en iyi ajan bu görevlerin yüzde 30'unu çözebiliyor.
Görevlerin listesi, yöntem ve tam sonuç tablosu için: Terminal-Bench duyurusu ve GitHub deposu.