إجابتان جديدتان لمشكلة ذاكرة الوكلاء مع فتح تينسنت مصدر ContextPilot

برز في الأسبوع نفسه عملان يعالجان تضخم سياق الوكلاء في المهام الطويلة: إطار ContextPilot المدرب بالتعلم المعزز من تينسنت، وبنية SKILL.state المقبولة في EMNLP التي تستبدل التاريخ بحالة قابلة للتحديث.

إجابتان جديدتان لمشكلة ذاكرة الوكلاء مع فتح تينسنت مصدر ContextPilot

أخبث مشكلات أنظمة الوكلاء هي طول المهمة: فمع إلحاق كل استدعاء أداة وكل ملاحظة وكل أثر تعليل وسيط بتاريخ المحادثة، يتضخم السياق ويتباطأ النموذج، ويبدأ عند نقطة ما التسمم بماضيه. برزت هذا الأسبوع إجابتان مختلفتان عن هذه المشكلة.

ContextPilot: نموذج يتعلم إدارة السياق

يعلم إطار ContextPilot الذي فتحت تينسنت مصدره إدارة السياق للنموذج نفسه. فإلى جانب الأدوات الكلاسيكية مثل البحث والحذف والتلخيص، يضيف التخطيط والذاكرة طويلة الأمد والتفريغ الناعم للسياق؛ ويتعلم النموذج عبر التعلم المعزز جمع المعلومات المتناثرة عبر التفاعلات متعددة الأدوار مع إبقاء سياق العمل صغيرًا. وتلفت الانتباه تقنيتان في التدريب: تركيز الاستكشاف على قرارات تحرير السياق الحساسة، وإسناد المكافآت بدقة إلى اللقطات الوسيطة بحسب نتائج الفروع اللاحقة بدل توزيعها بالتساوي على المسار كله. ويسجل الإطار نتائج أقوى بسياق عمل أصغر على InfBench وNovelQA وLongMemEval وBrowseComp+، مع وصفات تدريب منشورة لنموذجي Qwen3-8B و14B.

SKILL.state: حدّث الحالة ولا تكدس التاريخ

أما بحث SKILL.state المقبول في EMNLP فأكثر جذرية: لا تراكم تاريخ المحادثة أصلًا. يتلقى النموذج في كل خطوة ثلاثة مدخلات فقط: مواصفة المهمة، والحالة المهيكلة الحالية، وآخر ملاحظة. ويجري التخلص من التعليل الوسيط فور إنتاج تحديث الحالة. والنتيجة: دقة أعلى في المهام الطويلة مع انخفاض كبير في استهلاك الرموز.

الدرس المشترك واضح: لم يعد التفوق في سباق الوكلاء بحجم النموذج بل بانضباط إدارة السياق. وهو على الخط نفسه مع خبرنا عن مصنع برمجيات أوبر ونقاش AGENTS.md هذا الأسبوع: المعلومات الزائدة لم تعد عونًا بل عبئًا. وقد طبقنا الدرس على خط نشرنا أيضًا: صار مدقق القراءة الأخيرة لدينا يتلقى نصًا مجردًا بدل HTML الخام، ومع كل ملاحظة شرط اقتباس حرفي من النص.

Devamını oku