Stanford, yapay zeka ajanlarını bilimsel iş akışlarında ölçen bir kıyaslama yayımladı

Terminal-Bench-Science'ın ilk sürümünde, araştırmacıların gerçekten yaptığı işlerden alınmış 70 görev var. İlk sonuçlarda en iyi ajan görevlerin yüzde 30'unu bitirebiliyor.

Stanford, yapay zeka ajanlarını bilimsel iş akışlarında ölçen bir kıyaslama yayımladı

Stanford öncülüğündeki bir çalışma, yapay zeka ajanlarını yazılım geliştirme yerine bilimsel araştırma iş akışlarında ölçen Terminal-Bench-Science kıyaslamasını yayımladı.

İlk sürümde 70 görev var; hepsi çalışan araştırmacıların gerçekten yaptığı işlerden alınmış. İlk sonuçlarda en iyi ajan bu görevlerin yüzde 30'unu çözebiliyor.

Görevlerin listesi, yöntem ve tam sonuç tablosu için: Terminal-Bench duyurusu ve GitHub deposu.