Code World Model: الشيفرة تحفظ حالة العالم والنموذج يرسم الفيديو
باحثون من Westlake وNTU يسندون تطوّر العالم إلى وكيل برمجي، والإخراج البصري إلى نموذج فيديو. الشيفرة والأوزان منشورة بشكل مفتوح.
نشر باحثون من مختبر AGI في جامعة Westlake وجامعة نانيانغ التكنولوجية إطار عمل أطلقوا عليه اسم Code World Model (CWM). ويفصل هذا الإطار بين الجزء الذي يحسب كيفية تطوّر العالم والجزء الذي يحوّله إلى صورة.
أما المشكلة التي يعالجونها فهي أن نماذج العالم القائمة على الفيديو تتعلّم الديناميكيات من الملاحظة البصرية وحدها. وهذا يُظهر نتيجة الحدث لا الآلية الكامنة خلفه، ما يصعّب الحفاظ على النتائج الدائمة ومواصلة تطوّر متّسق ومفتوح النهاية.
ويقسم CWM المهمّة. فوكيل برمجي — يسمّيه الباحثون "دماغ العالم" — يستدلّ على الأحداث ونتائجها، ويولّد شيفرة قابلة للتنفيذ تحفظ حالة العالم بصورة دائمة وتدفعها إلى الأمام وفق القواعد. ثم تُرمَّز القيود المكانية-الزمانية الناتجة إطارًا إطارًا في تمثيل وسيط يُجمَّع في فيديو وسيط، ويتولّى نموذج الفيديو إخراج الصورة استنادًا إلى تلك المواصفات.
وفي جانب الفيديو، درّب الفريق نموذج MiniMax-H3 تدريبًا دقيقًا على بيانات لعب مقترنة. واختيار الألعاب ليس عرضيًا: فبحسب البحث، إطارات اللعبة هي أصلًا ناتج بصري لتنفيذ شيفرة، ومن ثمّ فإن تعلّم ربط مباشر بين الفعل والفيديو يعني مطالبة النموذج بمحاكاة مخرجات البرنامج ضمنيًا.
والعمل من إعداد Yiwen Chen وGuosheng Lin وChi Zhang. ولا تنشر صفحة المشروع نتائج مقارنات مرجعية. والشيفرة متاحة على GitHub والنموذج على Hugging Face.
للتفاصيل: صفحة المشروع، والبحث على arXiv، والشيفرة على GitHub.