في عصر تتسارع فيه التطورات في مجال الذكاء الاصطناعي، نُقدم لكم وصفة "Rufus-Air"، وهي نظام مفتوح وقابل للتكرار والذي يتميز بقدراته المتقدمة في مرحلة ما بعد التدريب. تم تنظيم هذه الوصفة على نموذج "GLM-4.5-Air-Base"، حيث تتكون من ثمانية مراحل متكاملة تشمل: التعلم تحت الإشراف (SFT)، التعلم المعزز بالسببية (Reasoning RL)، التعلم المعزز بالبرمجة (Coding RL)، التعلم المبني على تعليمات محددة (Instruction-Following RL)، والوكيل العام (General Agent)، ووكيل البرمجة (Coding Agent)، ووكيل البحث (Search Agent)، وأخيراً التعلم المعزز مع التغذية الراجعة البشرية (RLHF).

تعد هذه المراحل ذات تسلسل متدرج، حيث ينتقل التعلم من القدرات الأساسية إلى القدرات المتطورة، واستنادًا إلى مكافآت قابلة للتحقق ثم إلى مؤشرات تعسفية أكثر في مراحل لاحقة.

رغم الاعتماد على مكونات مفتوحة المصدر، فإن ما يميز "Rufus-Air" هو نتائجنا الرائعة التي تم توثيقها في هذا العمل. لعل أهم ما توصلنا إليه هو أن:
1. وجود تنوع عالي الجودة في عملية التعلم تحت الإشراف يرفع من مستوى الأداء.
2. تصفية الصعوبات تساعد في الحفاظ على دقيقة التعلم ضمن نطاق تعليمي مفيد.
3. موثوقية المكافآت تعتبر مبدأ عملي يُرشد ترتيب المراحل.
4. اختيارات البنية التحتية والهندسة تشكل جزءًا من الوصفة وليست مجرد تفاصيل تنفيذية.

من خلال هذه العوامل، تُظهر "Rufus-Air" تحسنًا واضحًا مقارنةً بالإصدارات السابقة من "GLM-4.5-Air" وهي تنافس النماذج المفتوحة المماثلة لها في الحجم.

هل تعتقد أن هذه الوصفة ستغير قواعد اللعبة في عالم الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!