Stanford
Stanford, yapay zeka ajanlarını bilimsel iş akışlarında ölçen bir kıyaslama yayımladı
Terminal-Bench-Science'ın ilk sürümünde, araştırmacıların gerçekten yaptığı işlerden alınmış 70 görev var. İlk sonuçlarda en iyi ajan görevlerin yüzde 30'unu bitirebiliyor.