في عالم الذكاء الاصطناعي، تعد مهمة اكتشاف خطاب الكراهية في اللغات ذات الموارد المنخفضة (Low Resource Languages) تحدياً كبيراً، خاصة في ظل غياب البيانات المعلّمة وعدم وجود قواعد نحوية موحدة. بينت دراسة جديدة فعالية استخدام نماذج لغوية كبيرة (Large Language Models) لاكتشاف خطاب الكراهية في الأوردو الروماني، وهي لغة مشهورة بين مستخدمي وسائل التواصل الاجتماعي في جنوب آسيا.
ركزت الدراسة على تقييم أداء نماذج متعددة مثل **Mistral** و**LLaMA** و**Falcon** والانموذج متعدد اللغات **BERT**، حيث استخدم الباحثون أسلوب تدريب فعال يعرف باسم **Parameter-Efficient Fine-Tuning (PEFT)** مع تقنية **Low-Rank Adaptation (LoRA)** لتحسين أداء هذه النماذج في كشف الخطاب الكراهي.
تم إجراء التجارب باستخدام مجموعة بيانات **PURUTT** المكونة من أكثر من 72,000 تعليق معتمد، وظهرت النتائج التي تشير إلى أن النماذج تحقق أداءً معتدلاً في البداية (F1 = 0.56)، لكن تحديث جزء صغير من المعلمات القابلة للتدريب حقق تحسينًا كبيرًا في الأداء (F1 > 0.93).
تظهر هذه النتائج أن استخدام أسلوب PEFT لا يوفر فقط أداءً متميزًا بل يتمتع أيضًا بكفاءة حاسوبية عالية، مما يجعله ملائمًا جداً لمهام معالجة اللغات ذات الموارد المنخفضة. هل ترغب في معرفة كيف يمكن تطويع هذه النماذج في مجالات أخرى؟ شاركونا آراءكم في التعليقات!
اكتشاف الكراهية: تحسين النماذج اللغوية الكبيرة للغات ذات الموارد المنخفضة
درس جديد يسلط الضوء على كيفية تحسين النماذج اللغوية الكبيرة (LLMs) لاكتشاف خطاب الكراهية في اللغات ذات الموارد المنخفضة مثل الأوردو الروماني. النتائج تظهر تحسناً ملحوظاً في الأداء باستخدام أساليب تدريب فعّالة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
