شهدت نماذج اللغة الكبيرة (Large Language Models) مثل GPT-4o وClaude Sonnet 4.5 وGemini 2.5 Flash اختبارًا مثيرًا للاهتمام يتعلق بلغة الأوردية، التي تتواجد في المرتبة العاشرة من حيث عدد المتحدثين، حيث يلامس عددهم 246 مليون شخص. توضح الدراسة أن الأوردية تظل شبه غائبة عن تقييمات السلامة في هذه النماذج، مما قد يؤدي إلى قلة موثوقية مراقبة المحتوى.
فقد تم إجراء اختبارات على خمس نماذج كبيرة عبر ستة مجموعات بيانات تشمل الأوردية الأصلية والأوردية الرومانية والإنجليزية. رغم أن النماذج تعمل بكفاءة، إلا أنه لوحظت مشاكل واضحة في تباين التسمية بين تصنيفات النصوص الأوردية والترجمة الإنجليزية، حيث تراوحت نسبة عدم الاستقرار بينهما من 15.9% إلى 31.6%.
نتيجة 'Missed-in-Urdu'، التي تعني محتوى تم تصنيفه على أنه ضار في الترجمة الإنجليزية بينما تم اعتباره عاديًا في النص الأصلي، وصلت نسبتها بين 2.4% و9.9%، مع متوسط 4.3%. هذه النتائج تشير إلى أن نماذج اللغة الحالية تقدم تأكيد سلامة غير متوازن عبر أنواع النص المختلفة للغة الأوردية، حيث أظهرت النماذج ذات الوزن الأدنى معدلات عدم استقرار وغياب للأذى أعلى بكثير من النماذج المغلقة.
يواجه مجال تقييم سلامة المحتوى تحديات كبيرة في حال استمرار غياب الأوردية، وهو ما يستدعي ضرورة إدراجها في الأجندات البحثية المستقبلية.
أزمة التوازن في سلامة المحتوى: ماذا تُظهر الأرقام عن نموذج اللغة الأوردية؟
تكشف دراسة جديدة عن غياب تقييم الأمان للغة الأوردية في نماذج اللغة الكبيرة، مما يؤدي إلى مشكلة كبيرة في سلامة المحتوى. نتائج الاختبارات تشير إلى تباين خطير في تصنيف المحتوى بين النصوص الأوردية والإنجليزية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
