في عالم التعلم المعزز (Reinforcement Learning) لوكلاء نماذج اللغات الكبيرة (Large Language Models)، يمثل إسناد الفضل بدقة تحديًا رئيسيًا، خاصة في المهام التي تتطلب مدًى طويلاً. التقليد السائد كان يعتمد على مكافآت نهائية يمكن التحقق منها، حيث يتم الإبلاغ عن كل نتيجة نادرة لكل إجراء على المسار. ومع ذلك، تشمل الأساليب الحالية عادةً البحث عن وفرة أدق من الفضل من جانب الانطلاق، مثل بناء إشارات مسار مساعدة أو مقارنات إضافية لتقدير أهمية الإجراء.
لكن هنا تأتي فكرة VICT، أو "Tracing الائتمان المزود بالتحقق"، كحل جديد. هذه التقنية تقدم واجهة خلال زمن التدريب تكشف عن ذرات قابلة للتنفيذ أو مدعومة بالأدلة، وتعيد تتبعها إلى الإجراءات من خلال حواف إثبات متعلقة. وتمنح VICT إعادة توزيع للميزة النسبية للجماعة فقط على تلك الحواف، مما ينقل إسناد الفضل من استنتاج جانب الانطلاق إلى تتبع جانب المُراجع.
تحتفظ VICT بمكافأة النهاية الأصلية، وتتجنب العمل عندما تكون الأدلة غير مكتملة أو غامضة، ولا تغير إلا الموتر الخاص بالميزة خلال زمن التدريب، مما يتطلب عدم وجود ناقد متعلم أو تسميات عملية أو وصول إلى مُراجع خلال زمن الاستنتاج.
لقد أظهرت التجارب على ALFWorld وWebShop أن VICT تحقق تحسينًا كبيرًا مقارنة بالتدريب فقط على النتائج، إلى جانب أداء قوي بالمقارنة مع الطرق الحديثة لإسناد الفضل الدقيق. بفضل هذه التقنية، نحن نرى مستقبل الذكاء الاصطناعي يتحول نحو اتجاه أكثر دقة وكفاءة.
ما رأيكم في هذا التطور الجديد؟ شاركونا في التعليقات!
VICT: تقنية رائدة لتعزيز التعلم المعزز لوكلاء نماذج اللغات الكبيرة
تقدم تقنية VICT حلاً مبتكرًا لتحديات إسناد الفضل في التعلم المعزز للوكلاء على المدى الطويل. من خلال الاستفادة من التحقق الداخلي، تتمكن من إعادة توزيع الفضل بشكل أكثر دقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
