في عالم الذكاء الاصطناعي، يعتبر التعلم التعزيزي (Reinforcement Learning) أحد الطرق القوية لتدريب نماذج اللغات الكبيرة (Large Language Models). ولكن، على الرغم من فوائده العديدة، يواجه العلماء تحديات جديدة تتعلق بالتأخير في الأداء نتيجة لتوليد التراجم حتى بعد تحديث السياسات. في دراسة جديدة، قام الباحثون بدراسة كيفية تراكم هذا التأخير على مدى عمر الترجمة وأهمية السيطرة عليه دون فقدان فوائد التنفيذ غير المتزامن.
تم تقسيم التأخير إلى نوعين رئيسيين: التأخير الناتج عن التوليد (Generation Staleness)، الذي يجمع قبل اكتمال الترجمة، والتأخير الناتج عن الانتظار (Waiting Staleness)، الذي يحدث بعد دخول الترجمة المكتملة إلى مجموعة النتائج.
استنادًا إلى هذا التقسيم، تم تقديم نظام PACE (Pool-Aware Control of Effective Staleness) الذي يساهم في تحويل الازدحام الزائد في مجموعة النتائج إلى ميزانية قبول متكيفة. حيث يقوم هذا النظام بتصنيف التراجم المكتملة وفقًا لدرجة التأخير الفعالة التي تجمع بين التأخير الناتج عن الانتظار وتأخير التوليد.
أظهرت التجارب أن نظام PACE يحسن دقة الأداء في ستة معايير متوسطة بقيمة 18.7% مقارنة بالتعلم التعزيزي غير المفلتر، مع نفس الميزانية الزمنية. وأضاف النظام تحسينًا في الأداء في قدرات التفكير المعقدة والرياضيات، outperforming أنظمة التعلم التعزيزي الأخرى. هذه النتائج تفتح آفاق جديدة في استخدام التعلم التعزيزي مع نماذج اللغات الكبيرة، وإمكانية تكييفه عبر هياكل النماذج وخوارزميات التدريب المختلفة.
بشكل عام، تشير هذه الدراسة إلى خطوات مثيرة نحو تحسين كيفية استفادة الذكاء الاصطناعي من استراتيجيات التعلم المتقدمة، مما يؤدي في النهاية إلى تحسينات حقيقية في الأداء.
تحكم فعال في فترات التراجم: كيفية إدارة التأخير في التعلم التعزيزي لنماذج اللغات الكبيرة
تقدم الدراسة الجديدة طريقة مبتكرة للتحكم في فترات التأخير في التعلم التعزيزي لنماذج اللغات الكبيرة، مما يحسن من دقة الأداء وتقليل وقت الاستخدام. تعرفوا على نظام PACE الذي يعيد تعريف كيفية معالجة التراجم للحصول على أفضل النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
