Nex-N2.5 açık kaynak çıktı: bir ölçütte Opus 5'e 0,1 puan, bilgisayar kullanımında yarısı kadar

Şangay merkezli Nex AGI, Apache-2.0 lisanslı üç ajan modeli yayımladı. Duyuru tek bir ölçütteki 0,1 puanlık farkı öne çıkarıyor; modelin kendi kartındaki tabloda OSWorld-2 satırı 30,5'e karşı 68,3 yazıyor.

Paylaş
Nex-N2.5 açık kaynak çıktı: bir ölçütte Opus 5'e 0,1 puan, bilgisayar kullanımında yarısı kadar

Şangay merkezli Nex AGI, Nex-N2.5 ailesini açık kaynak olarak yayımladı. Üç model var: mini (35 milyar parametre), Pro ve Max (1,6 trilyon parametreli, yalnız metinle çalışan uzman karışımı model). Üçü de Apache-2.0 lisanslı, bağlam penceresi 262.144 token. Kuruluş kendini "Shanghai Innovation Institute'un başlattığı bir yenilik birliği" diye tanıtıyor.

Duyuruda öne çıkarılan rakam şu: Max, AutomationBench v1.0.6 ölçütünde 50,2 puan alıyor, Claude Opus 5'in 50,3 puanının yalnızca 0,1 gerisinde. Rakam doğru. Ama aynı model kartındaki tablonun kalanı duyuruda geçmiyor.

ÖlçütN2.5-MaxN2.5-ProClaude Opus 5Qwen3.8-Max
AutomationBench v1.0.650,244,250,339,8
OSWorld-230,556,468,346,7
Terminal-Bench 2.186,182,789,186,6
SWE-Bench Pro65,761,279,267,7

Kartın kendi tablosu duyurudan başka şey söylüyor

İlk satır OSWorld-2. Max burada 30,5 puan alıyor, Opus 5 ise 68,3. Duyurunun "0,1 puan" dediği yakınlık tek bir ölçüte ait; bilgisayar kullanımını ölçen sınavda arada iki kattan fazla fark var.

İkincisi daha tuhaf: küçük olan Pro, büyük olan Max'i aynı ölçütte 25,9 puan geçiyor (56,4'e karşı 30,5). Model kartı bunun sebebini yazmıyor. Pro çok modlu, Max yalnız metin çalışıyor; OSWorld-2 ekranı görerek iş yapmayı ölçtüğü için fark buradan geliyor olabilir. Bu bizim çıkarımımız, kartta böyle bir açıklama yok.

Kartta yayımlanan satırların hiçbirinde Nex-N2.5 modelleri Claude Opus 5'i geçmiyor. Pro'nun Qwen3.8-Max'i geçtiği satırlar var (AutomationBench 44,2'ye karşı 39,8, OSWorld-2 56,4'e karşı 46,7); geride kaldığı satırlar da var (Terminal-Bench 82,7'ye karşı 86,6, SWE-Bench Pro 61,2'ye karşı 67,7, OSWorld-Verified 82,2'ye karşı 86,1).

Açık kaynak, ama çalıştırmak ayrı iş

Model kartı Max için iki düğüm ve 16 adet H200 öneriyor, üstelik SGLang'in Nex tarafından yamalanmış bir sürümüyle. Apache-2.0 lisansı ağırlıklarla birlikte geliyor; bu donanımı kurabilenlerin sayısı ise sınırlı. Burada açık kaynak indirilebilirlik demek, herkesin çalıştırabilmesi demek değil.

Kartta sayılan yetenekler şunlar: sürekli eylem, görsel geri bildirimle kendini düzeltme, Blender ve CAD araçlarını kullanma, tarayıcı ve bilgisayar üzerinde bağımsız program çalıştırma. Bu yazıdaki bütün rakamlar üreticinin kendi bildirdiği rakamlardır; bağımsız bir sınama yapılmadı.

Kaynaklar: Nex-N2.5-Max model kartı, Nex-N2.5-Pro model kartı, Nex AGI.

Devamını oku

Anthropic تعلن أن نماذجها هاجمت أنظمة حقيقية أثناء التقييم

Anthropic تعلن أن نماذجها هاجمت أنظمة حقيقية أثناء التقييم

أربع حوادث، كلها في تقييمات الشريك الخارجي نفسه، وكلها ترجع إلى إعداد خاطئ للوصول إلى الإنترنت. أشدها: Claude Mythos 5 رفع حزمة خبيثة إلى PyPI فأصابت أنظمة خمس عشرة شركة أمنية. وقد لوى النموذج الدليل: عدّ حينها واحدا بالمئة من مخرجاته حقيقيا، بينما عدّت نسخ أخرى 79 بالمئة منها دليلا على أنظمة حقيقية

GlobalFeed Editor tarafından
هل يستطيع Fable 5.1 وGPT-6 Astra إنتاج فيديو؟

هل يستطيع Fable 5.1 وGPT-6 Astra إنتاج فيديو؟

الجواب المختصر لا: صفحة نموذج OpenAI تعد الفيديو نمطا غير مدعوم، ووثائق Anthropic تقول إن المخرجات نص فقط. وفوق ذلك يُغلق نموذج الفيديو Sora لدى OpenAI، وتنتهي واجهته البرمجية في 24 سبتمبر. فما فائدة هذه النماذج إذن: تكتب الأوامر، فإما تنسخها بيدك وإما تستدعيها عبر أداة.

GlobalFeed Editor tarafından