في عالم الذكاء الاصطناعي، يعد التعلم الذاتي على السياسة (On-policy Self-Distillation) وسيلة متقدمة توفر إشرافًا كثيفًا على مستوى التوكنات دون الحاجة إلى نموذج ثانٍ، حيث يعمل نموذج واحد كمعلم وآخر كطالب. ولكن، كما هو الحال في أي تقنية جديدة، هناك تحديات تظهر خلال العملية.
تتمثل إحدى المشاكل الكبيرة في أن انتروبيا توكن الطالب ترتفع أحيانًا لتتجاوز معلمها وتبقى مرتفعة، وهو ما يُعرف بمشكلة "تجاوز الانتروبيا" (entropy overshoot). يبرز هذا التحدي أثناء التدريب، حيث يكون المعلم واثقًا من إجاباته، ولكن هذه الثقة تنتقل بشكل سيء إلى التوكنات التي ينتجها الطالب، مما يجعل الإشراف مفرط الربط بالدلالات الخاصة بالإجابة بدلاً من أنماط التفكير القابلة لإعادة الاستخدام.
للتغلب على هذه المشكلة، تم تقديم نظام E$^2$-OPSD لتقديم تحسينات ملحوظة. يعتمد النظام على مبدأ التعليم الموجه من خلال أمثلة، حيث يتم استبدال الإجابة الحالية بمشكلة قريبة تم حلها مسبقًا، مما يوفر إرشادات تفكير قابلة للنقل دون الكشف عن الهدف النهائي.
أيضًا، استخدم النظام أسلوب "التقطيع الواعي للانتروبيا" (entropy-aware distillation) لاستغلال الفجوة في الانتروبيا بين الطالب والمعلم، وبالتالي تحديد اتجاه وقوة تصحيح كل توكن.
تظهر نتائج التجارب أن E$^2$-OPSD استطاع تحسين مهارات التفكير الرياضي بمعدل يصل إلى 4.3 نقطة، بينما أظهرت التقييمات خارج النطاق مكاسب تصل إلى 4.9 نقطة، مما يدل على فعالية النظام في تحقيق نتائج أفضل مقارنةً بالنماذج الأساسية المقابلة.
الأهم من ذلك، يبقى نظام E$^2$-OPSD بسيطًا في التنفيذ، حيث لا يحتاج إلى خطوات إضافية أو نماذج جديدة، مما يجعله جذابًا للباحثين والممارسين في هذا المجال.
ما رأيكم في هذه التطورات التقنية المثيرة؟ شاركونا أفكاركم في التعليقات.
نظام E$^2$-OPSD: الحل الأمثل لتقليل مشكلة تجاوز الانتروبيا في التعلم الذاتي على السياسة
تستكشف الدراسة الأخيرة نظام E$^2$-OPSD كحل مبتكر لمشكلة تجاوز الانتروبيا التي تواجه نماذج التعلم الذاتي على السياسة. يحقق النظام تحسينًا ملحوظًا في دقة الرياضيات دون الحاجة إلى نماذج إضافية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
