تظل مشكلة نقص مجموعات البيانات المُعززة عالية الجودة لتقنية البحث (IR) في اللغات منخفضة الموارد معضلة كبيرة. فالاعتماد على التوصيف اليدوي لهذه البيانات ليس فقط مكلفًا، بل من الصعب توسيعه ليناسب احتياجات البحث المتزايدة. ومن جهة أخرى، استخدام نماذج لغوية ضخمة (LLMs) كمُعززين ذاتيين يثير تساؤلات حول موثوقية التصنيفات والمخاوف من التحيز وصحة التقييم.
في إطار هذا البحث، تم عرض مجموعة بيانات بحثية بلغة البنغالية تم إنشاؤها باستخدام إطار عمل BETA-labeling، والذي يضم مُعززين من نماذج لغوية كبيرة متباينة. يُعزز هذا الإطار من موثوقية البيانات من خلال دمج المحاذاة السياقية وفحوصات الاتساق، بالإضافة إلى تقييمات بشرية لضمان جودة التصنيف.
وليس هذا فحسب، بل بحثنا أيضًا في كيفية إعادة استخدام مجموعات بيانات البحث من لغات نادرة أخرى من خلال الترجمة الآلية لمرة واحدة. باستخدام تقنيات الترجمة القائمة على نماذج لغة كبيرة عبر لغات متعددة، أجرينا تجارب على الحفاظ على المعنى وصحة المهمة بين مجموعات البيانات الأصلية والمترجمة. وأظهرت تجاربنا تباينًا ملحوظًا عبر اللغات، مما عكس التحيزات المرتبطة باللغة وعدم الاتساق في الحفاظ على المعنى، مما يؤثر بشكل مباشر على موثوقية إعادة استخدام مجموعات البيانات عبر اللغات.
في المجمل، تبرز هذه الدراسة كلًا من الإمكانيات والتحديات المرتبطة باستخدام نماذج اللغة في إنشاء مجموعات بيانات لقضايا البحث في اللغات النادرة. كما تقدم أدلة تجريبية حول المخاطر المرتبطة بإعادة استخدام مجموعات البيانات العابرة للغات، وتوفر إرشادات عملية لبناء معايير أكثر موثوقية وخطوط تقييم في إعدادات اللغة ذات الموارد المحدودة.
بذكاء اصطناعي: إنشاء مجموعات بيانات متعددة اللغات لدعم البحث في اللغات النادرة
في دراسة جديدة، تم تطوير مجموعة بيانات لتقنية البحث في اللغات النادرة باستخدام إطار BETA-Labeling. يتناول البحث تحديات البيانات المحدودة ويقدم استراتيجيات فعّالة للتغلب عليها باستخدام نماذج لغوية ضخمة (LLMs).
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
