تواجه تقنيات تبسيط النصوص التلقائي (Automatic Text Simplification - ATS) تحديات متعددة، خاصةً لعدم توافق تقدمها مع التطورات السريعة في معالجة اللغات الطبيعية. في سعيهم لتجاوز هذه العقبات، تناول الباحثون في ورقة جديدة كيفية استخدام تقنيات تعلم التعزيز (Reinforcement Learning - RL) لزيادة جودة عمليات التبسيط للغات ذات الموارد المحدودة، مثل الكاتالونية.
تكمن النقطة الرئيسية في هذه الدراسة في تقديم دالة مكافأة جديدة تهدف إلى توجيه نماذج اللغة الكبيرة (Large Language Models - LLMs) نحو أسلوب تبسيط محدد. يعزز الباحثون هذه الدالة من خلال تطبيق تقنية تحسين السياسة النسبية الجماعية (Group Relative Policy Optimization - GRPO) التي تجتمع فيها قياس SARI مع مكونات عقابية معينة، مما يمكن النماذج من تحقيق نتائج أفضل.
تظهر النتائج أن أداء النموذج المدرب لاحقًا، وهو IberianLLM-7B-Instruct، قد تحسن بشكل ملحوظ بعد التدريب على مجموعة بيانات ASSET، حيث شهدت نماذج الأداء في معيارين كاتالونيين تحسينًا كبيرًا مع تقليل السلوكيات السلبية المعروفة سابقًا. كما تم استكشاف التعلم عبر اللغات من خلال ترجمة ASSET إلى الكاتالونية والإسبانية، ولكن لم تظهر تحسنات ملحوظة في معايير التحسين في مجال العمليات المختلفة.
تظهر هذه الدراسة أن هناك إمكانيات كبيرة لتطبيق تقنيات تعلم التعزيز في تحسين أداء النماذج اللغوية، مما يوفر آفاقًا جديدة لتبسيط النصوص في اللغات التي تفتقر إلى الموارد الكافية.
تعلم التعزيز: كيفية تعزيز نماذج اللغة الكبيرة في تبسيط النصوص الكاتالونية
تستكشف ورقة بحثية جديدة استخدام تقنيات تعلم التعزيز لتحسين جودة تبسيط النصوص التلقائي للغات ذات الموارد المحدودة. من خلال تقديم دالة مكافأة مبتكرة، يتمكن الباحثون من توجيه نماذج اللغة الكبيرة نحو أسلوب تبسيط مستهدف.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
