Goodfire: bir akıl yürütmenin nerede biteceğini birkaç çatal kelime belirliyor

Şirket, modelin düşünce zincirindeki her adımı yeniden örnekleyerek sonucu asıl değiştiren token'ları arıyor. Aynı zamanda araştırma ajanı Silico'yu genel kullanıma açtı.

Paylaş
Goodfire: bir akıl yürütmenin nerede biteceğini birkaç çatal kelime belirliyor

Yorumlanabilirlik alanında çalışan Goodfire, dil modellerinin akıl yürütme zincirlerini inceleyen bir yöntem yayımladı: Çatal Yollar Analizi.

Yöntemin mantığı basit. Model bir soruyu adım adım düşünürken, her adımda zinciri o noktadan itibaren defalarca yeniden çalıştırıyorsunuz. Sonra bütün bu alternatif yolların vardığı cevapları toplayıp bir dağılım çıkarıyorsunuz. Böylece zincirin hangi noktasında cevabın gerçekten değiştiği görülüyor.

Çıkan sonuç şu: uzun bir düşünce zincirinin her parçası eşit ağırlıkta değil. Sonucu belirleyen birkaç çatal token var; modelin cevabı çoğu zaman tek bir kelimelik mesafede duruyor. Şirket bunun akıl yürütmeyi denetlemek açısından önemli olduğunu, çünkü zincirin tamamını değil kritik birkaç noktayı izlemenin yetebileceğini savunuyor. Goodfire yöntemin aynı bilgiyi önceki yaklaşımlara göre çok daha az hesapla verdiğini bildiriyor; bu verimlilik rakamı şirketin kendi ölçümü.

Goodfire ayrıca araştırma ajanı Silico'yu genel kullanıma açtı. Şirketin anlatımına göre platform, yorumlanabilirlik literatüründen üç çalışmayı (Interpretability in the Wild, ROME ve Mixing Mechanisms) yazarlarının koduna erişmeden yeniden üretti. Silico ücretli bir hizmet olarak sunuluyor.

Şirketin çalışmaları Goodfire araştırma sayfasında.