في عالم الذكاء الاصطناعي المتقدم، يمثل نموذج Gated-BEPO إنجازًا بارزًا في تدريب نماذج اللغات الكبيرة (Large Language Models) في بيئات معقدة وطويلة الأمد. تتطلب عملية التدريب الفعّالة في هذه البيئات توزيع الائتمان بشكل دقيق من النتائج النهائية إلى الإجراءات الفردية، وهو ما تعجز عنه الأساليب التقليدية التي تستخدم طرقًا غير نقدية.
تعمل الأساليب السابقة على توزيع المكافآت عبر مسارات كاملة، ولكنها قد تخلط بين الإجراءات الفعالة وغير الفعالة. بينما تقوم بعض الطرق الحديثة بتشكيل مجموعات على مستوى الخطوة عبر مطابقة الحالات المتكررة، مما يتيح مقارنة الإجراءات داخل كل مجموعة، إلا أنها تعاني من عجز في تمييز الإجراءات المفيدة في المسارات الفاشلة.
هنا يأتي دور Gated-BEPO، الذي يضع الأساس لنموذج قوي يمكنه تقييم الائتمان على مستوى الخطوة من خلال إنشاء رسوم بيانية تجريبية، حيث يقوم بجمع البيانات من كل مجموعة وتقدير قيم العقد باستخدام نقطة ثابتة لـ Bellman تعكس توزيع الإجراءات المتاح في السياسة الحالية.
باستخدام تقدير الفائدة العامة، يعمل Gated-BEPO على تجميع فائض الاختلافات الزمنية على طول كل مسار مختار، ليتضمن كلاً من التأثيرات الفورية والمستقبلية. والفائدة الكبرى، أنه باستخدام بوابة الثقة، يقوم النموذج بدمج ائتمان Bellman من الولايات ذات الخلفيات المتعددة حيث تُظهر معلومات واضحة.
تم اختبار Gated-BEPO في بيئات مثل WebShop وALFWorld، بالإضافة إلى ألعاب مثل Sokoban، حيث أظهرت التجارب تحسنات مستمرة في نماذج اللغة والرؤية.
بفضل Gated-BEPO، نضمن توزيع الائتمان بشكل مدروس مما يسهم في تعزيز كفاءة وأنجح استخدام لنماذج اللغات الكبيرة.
Gated-BEPO: ثورة جديدة في توزيع الائتمان لنماذج اللغات الكبيرة!
استكشف تقنية Gated-BEPO، المبتكرة في توزيع الائتمان لنماذج اللغات الكبيرة، التي تعزز كفاءة التدريب في بيئات طويلة الأجل. هذه التقنية تسهم في التفريق بين الإجراءات الناجحة وغير الفعالة بكل ذكاء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
