Ollama, uzun yanıtlarda büyüyen bellek kullanımını düzeltiyor

Ollama'nın sürüm notlarına göre, MLX ile uzun yanıt üretiminde bellek tüketiminin aşırı artmasına yol açan sorun düzeltildi. Duyurulan düzeltme spekülatif çözümleme kullanılan üretim yolunu ilgilendiriyor; bütün modeller için genel bir hız artışı açıklaması değil.

Paylaş
Ollama, uzun yanıtlarda büyüyen bellek kullanımını düzeltiyor

Birincil kaynak

Ollama'nın sürüm notlarına göre, MLX ile uzun yanıt üretiminde bellek tüketiminin aşırı artmasına yol açan sorun düzeltildi. Duyurulan düzeltme spekülatif çözümleme kullanılan üretim yolunu ilgilendiriyor; bütün modeller için genel bir hız artışı açıklaması değil. github.com

Geliştirme kaydı sorunun nedenini de açıklıyor: üretim döngüsünün her 256 token sınırında boşa çıkan bellek havuzunu temizlemesi bekleniyordu. Ancak spekülatif üretim bir turda birkaç token ekleyebildiği için sayaç tam sınır değerine gelmeden onu aşabiliyor, temizleme denetimi devreye girmeyebiliyordu. github.com

Yeni denetim, turun 256 token katlarından birini geçmesini yeterli kabul ediyor. Böylece sayacın tam sınırda durması gerekmiyor; tek token üreten turlardaki bellek bırakma davranışı, sınırı atlayarak geçen turlara da uygulanıyor. github.com

Aynı sürüm, Ollama komutu ilk kez çalıştırıldığında oturum açma veya yerelde devam etme seçenekleri sunan bir başlangıç adımı da ekliyor. Kurulumun tamamlandığı bilgisi macOS ve Windows masaüstü uygulamasıyla paylaşılıyor. Yerel devam seçeneği sürüm notlarında ayrıca belirtiliyor. github.com

Bu haber yayımlanan teknik belgelere dayanıyor; GlobalFeed tarafından bağımsız performans testi yapılmadı.