تعتبر عملية تحديد وظيفة الجملة بشكل تلقائي عنصراً حيوياً في العديد من تطبيقات معالجة اللغة الطبيعية (Natural Language Processing) مثل أنظمة الحوار، وتحويل النص إلى كلام، والترجمة الآلية. ومع ذلك، ظلّت الموارد المرجعية لتصنيف وظائف الجمل البنغالية محدودة. لمعالجة هذه المشكلة، يقدم البحث الجديد مجموعة بيانات مكونة من 10,000 جملة بنغالية، تم تصنيفها يدوياً إلى أربع فئات وظيفية رئيسيّة: الخبرية، الاستفهامية، الأمرية، والانفعالية.

تتميّز مجموعة البيانات بتوازنها الجيد بين الفئات الأربع، حيث تم التحقق من موثوقية التعليق بفضل تحقيق نسبة Fleiss' Kappa تقدر بـ 0.82.

علاوة على ذلك، تمّ تقييم عدة تمثيلات ميزات بما في ذلك نموذج حقيبة الكلمات (Bag-of-Words)، TF-IDF، ونموذج Word2Vec، باستخدام مجموعة من المصنّفين في التعلم الآلي. كما تم استخدام نموذجين مختلفين من النماذج التجميعية، وهما النموذج التجميعي على مستوى واحد (Single-Level Ensemble) والنموذج التجميعي على مستوى مزدوج (Double-Level Ensemble)، لتحسين أداء التصنيف.

أظهرت النتائج التجريبية أن نموذج TF-IDF يتفوق دائماً على Word2Vec، على ما يبدو بسبب قدرته على إبراز المؤشرات اللفظية المميزة المرتبطة بوظائف الجمل، وخاصة عند استخدام مجموعة بيانات صغيرة لتدريب Word2Vec. تحقق نموذج DLE مع ميزات TF-IDF الأداء الأفضل بدقة تبلغ 0.95 وmacro-F1، مما يبرز فعالية التمثيلات اللفظية الندرة وتقنيات التعلم التجميعي.

تؤكد اختبارات التحقق المتبادل على قوة هذا المنهج، بينما يقدم أسلوب التفسير القائم على LIME رؤى حول توقعات النموذج. تساهم المجموعة المطورة وتقييم النموذج في إقامة نقاط انطلاق قوية لتصنيف وظائف الجمل البنغالية.