Ollama, uzun yanıtlarda büyüyen bellek kullanımını düzeltiyor
Ollama'nın sürüm notlarına göre, MLX ile uzun yanıt üretiminde bellek tüketiminin aşırı artmasına yol açan sorun düzeltildi. Duyurulan düzeltme spekülatif çözümleme kullanılan üretim yolunu ilgilendiriyor; bütün modeller için genel bir hız artışı açıklaması değil.
Ollama'nın sürüm notlarına göre, MLX ile uzun yanıt üretiminde bellek tüketiminin aşırı artmasına yol açan sorun düzeltildi. Duyurulan düzeltme spekülatif çözümleme kullanılan üretim yolunu ilgilendiriyor; bütün modeller için genel bir hız artışı açıklaması değil. github.com
Geliştirme kaydı sorunun nedenini de açıklıyor: üretim döngüsünün her 256 token sınırında boşa çıkan bellek havuzunu temizlemesi bekleniyordu. Ancak spekülatif üretim bir turda birkaç token ekleyebildiği için sayaç tam sınır değerine gelmeden onu aşabiliyor, temizleme denetimi devreye girmeyebiliyordu. github.com
Yeni denetim, turun 256 token katlarından birini geçmesini yeterli kabul ediyor. Böylece sayacın tam sınırda durması gerekmiyor; tek token üreten turlardaki bellek bırakma davranışı, sınırı atlayarak geçen turlara da uygulanıyor. github.com
Aynı sürüm, Ollama komutu ilk kez çalıştırıldığında oturum açma veya yerelde devam etme seçenekleri sunan bir başlangıç adımı da ekliyor. Kurulumun tamamlandığı bilgisi macOS ve Windows masaüstü uygulamasıyla paylaşılıyor. Yerel devam seçeneği sürüm notlarında ayrıca belirtiliyor. github.com
Bu haber yayımlanan teknik belgelere dayanıyor; GlobalFeed tarafından bağımsız performans testi yapılmadı.