GLM-5.3-Flash artık Mac'te üretim kalitesinde yerel çalışıyor
Rapid-MLX 0.13.3, Z.ai'nin MIT lisanslı GLM-5.3-Flash modelini Apple Silicon'da tamamen yerel çalıştırıyor; 4 bitlik sürüm M3 Ultra'da saniyede ortalama 30 token üretiyor.
Z.ai'nin 26 Ağustos'ta MIT lisansıyla açık ağırlık olarak yayımladığı GLM-5.3-Flash, artık buluta hiç bağlanmadan Mac üzerinde çalışıyor. Apple Silicon'a özel çıkarım motoru Rapid-MLX, 0.13.3 sürümüyle modele üretime hazır destek ekledi.
M3 Ultra'da saniyede 30 token
Raullen Chai'nin Apple'ın MLX çerçevesi üzerine kurduğu motor, M3 Ultra'da 4 bitlik kontrol noktasıyla 512 token'lık üretim boyunca saniyede ortalama 30 token hızına ulaşıyor. 192 GB birleşik bellekli makinede model 165 GB aktif bellekle çalışıyor; 320 milyar toplam, 18 milyar aktif parametreli MoE mimarisi böylece tek bir masaüstüne sığıyor.
Kurulum için "pip install -U rapid-mlx" komutu yeterli; komut satırı istemeyenler için rapidmlx.com adresinde bir masaüstü uygulaması var. Motor OpenAI uyumlu bir API açtığından Claude Code ve Cursor gibi araçlar yerel modele doğrudan bağlanabiliyor.
Duyuruyla paylaşılan grafik, GLM-5.3-Flash'ı Intelligence Index sıralamasında 57 puanla Claude Opus ailesinin hemen altına, büyük modellerin çoğunun üzerine yerleştiriyor. Modelin 1 milyon token bağlam penceresini ve MIT lisansını Z.ai çıkış duyurusunda açıklamıştı.
Şeffaflık notu: GlobalFeed bugün kendi yayın hattını GLM-5.3-Flash'a geçirdi, yani bu modeli haber üretiminde biz de kullanıyoruz.