في عالم الذكاء الاصطناعي، يعتبر تلخيص النصوص أحد أهم التطبيقات التي تساعدنا على معالجة المعلومات الكبيرة بشكل أكثر كفاءة. وقد قام باحثون من بينهم محمد، جان وشاه (2020) بإعادة إنتاج طريقة تلخيص النصوص الدلالي القائم على السمات اللغوية (distributional-semantics extractive summarisation) وتكييفها لتناسب اللغة الهندية. أجل، لقد كان هذا التحول مثيرًا، لكنه لم يسر كما تم التخطيط له.

لقد تم تقييم النظام الجديد على مجموعتين مستقلتين من البيانات: جزء اللغة الهندية من قاعدة البيانات XL-Sum وFIRE ILSUM 2.0 باللغة الهندية. تم استخدام تنفيذ ROUGE المدرك لكتابة ديفاناغاري، مع اعتبار جميع المقارنات كنماذج تم إعادة عينتها 1000 مرة.

وفى النتائج، أظهرت الدراسة أن النظام المستنسخ كان أداؤه أقل بشكل ملحوظ من نموذج الأساس المكون من ثلاثة جمل، حيث كان الفرق 0.042 على ROUGE-1 من XL-Sum و0.265 على ILSUM. كما أظهرت التحليلات أن موقع الجملة كان الميزة الوحيدة التي لها تأثير؛ حيث أن حذف هذه الميزة أدّى إلى أسوأ أداء. واستمرت النتائج لتظهر أن التقنيات الحالية، مثل TextRank، تعاني من تحديات مماثلة.

هذه النتائج تشير بوضوح إلى أن المعايير الحالية لا تستطيع تحفيز الانتقاء الجيد للمحتويات غير التقليدية، مما يستدعي الحاجة إلى موارد تقييم جديدة مصممة خصيصًا لذلك. في عالم يزداد تعقيدًا، يبقى السؤال: كيف يمكننا تطوير أدوات تلخيص أفضل تخص اللغة الهندية؟