تتقدم نماذج اللغات الضخمة (Large Language Models) كقوة محورية في عالم الذكاء الاصطناعي، حيث تُظهر أداءً قويًا في مهارات التفكير المنطقي. ولكن، يعاني استخدامها من تكاليف تدريب مكلفة، وهي مشكلة تتزايد بشكل خاص بالنسبة للنماذج المدمجة (Compact Models) التي تحتوي على كمية صغيرة من المعاملات (parameters). هنا يأتي دور MADA-RL - الإطار الثوري الجديد الذي تم تقديمه مؤخرًا.

MADA-RL هو إطار عمل بعد التدريب يخصص النماذج المدمجة إلى أدوار منتجة وناقدة، حيث يتم تدريبها باستخدام إشارات تعلم موجهة بالنقاش. هذا يعني أنه بدلاً من تعديل كل المعاملات، يتم التركيز على مجموعة صغيرة فقط باستخدام إضافات LoRA (Low-Rank Adaptation).

ما يميز MADA-RL هو مفهوم "ميزة الناقد المتناقض" (counterfactual critic advantage)، وهو قاعدة أساسية ديناميكية مُشَروطة بالأدوار تعيد تعريف ميزة الناقد كعائداته مطروحة منها دقة مجموعة المنتج، مما يجعل الناقدين يهدفون إلى تحسين نتائج المنتج وليس مجرد تكرار الإجابات الصحيحة.

وعند التطبيق، يتم تجميع الوكلاء المتخصصين في بروتوكولات متعددة الجولات خفيفة الوزن. ومن خلال تنفيذ اختبارات تفكير رياضي متعددة، أظهرت MADA-RL زيادة في دقة نموذج DeepSeek-R1-Distill-Qwen-1.5B من 39.9% إلى 41.9% مع استخدام 16 مرة أقل من المعاملات القابلة للتدريب مقارنةً بالمعايير التقليدية. بينما يقترب هذا النجاح من مستويات عالية، فإنه لم يتجاوز أقوى المعايير (DeepScaleR وSTILL-3)، التي تم تدريبها على مجموعات بيانات أكبر بكثير.

يظهر التحليل أن ميزة MADA-RL توفر أفضل معدل لتحسين الناقد مقارنة بأي نموذج آخر تم تقييمه، مما يدل على أن النقاد المدربين يتعلمون كيفية تصحيح أخطاء المنتج بدلاً من تقليدها.