Applied Compute تفتح التدريب الكامل لـKimi K3: انخفاض وحدات المعالجة لكل نسخة 40 في المئة
الضبط الدقيق لنموذج Moonshot المفتوح الأوزان بثلاثة تريليونات معامل على AC2: مشغّلات مخصصة تحرر نحو 90 غيغابايت لكل وحدة، واستدلال MXFP4 يعمل على عقدتين بدل أربع.
فتحت Applied Compute التدريب الكامل بالضبط الدقيق لنموذج Kimi K3 - نموذج Moonshot المفتوح الأوزان بثلاثة تريليونات معامل - على سحابتها للوكلاء AC2، ونشرت التقرير الهندسي وراء ذلك. تحسينات الذاكرة لدى الشركة تخفض عدد وحدات معالجة الرسوميات اللازمة لكل نسخة تدريب بنحو 40 في المئة، وهي عتبة كلفة مهمة لتدريب النماذج المفتوحة على النطاق الحدودي.
يأتي معظم المكسب من ثلاثة مواضع. فالمشغّلات المخصصة لتفعيلات SiTU-GLU تعيد حساب الموترات الوسيطة أثناء الانتشار الخلفي بدل تخزينها، فتحرر نحو 90 غيغابايت من الذاكرة عالية النطاق لكل وحدة معالجة - أي نحو ثلث الذاكرة الكلية. وخطوات محسّن Adam المجزأة تقتطع 4 بايتات من أصل 12 بايتًا لكل معامل من ذاكرة المضيف. وعلى جانب الاستدلال، تعمل محركات MXFP4 منخفضة الدقة على عقدتي B300 بدل أربع عقد لـbf16؛ وتباعد KL المقيس مماثل لفارق التدريب والاستدلال في bf16 نفسه، جزئيًا لأن 47 في المئة فقط من المعاملات النشطة - نحو 49 من 104 مليارات - تنزل إلى الدقة المنخفضة.
ويغطي التقرير أيضًا الأعمال الأقل بريقًا: فقد تبيّن أن نقل الأوزان أثناء التشغيل كان يفسد عمليات rollout عبر ذاكرة Block Attention Residuals المؤقتة، فصارت تُعاد حسابها مع كل تحديث؛ وتسارعت كتابة نقطة تحقق حجمها 28 تيرابايت 2.2 مرة على Weka و4.4 مرات على NFS بعد تجاوز ذاكرة صفحات لينكس عبر O_DIRECT.
وتقدّم الشركة النتيجة بمثال ملموس: بعد 50 خطوة تدريب في يوم واحد، بلغ وكيل برمجي أداءً احتاج نموذج أصغر بثلاثمئة مليار معامل أيامًا لبلوغه. وتقول إن التحسينات ليست خاصة بـKimi K3 بل تنتقل إلى بقية نماذج المنصة أيضًا.
المصدر: تقرير Applied Compute