تُعتبر مشكلة تلوث البيانات (Data Contamination) من التحديات الكبرى التي تواجهها النماذج اللغوية الحديثة، حيث يمكن أن يُؤثّر المحتوى المكرر على التقييمات الحقيقية لنماذج الذكاء الاصطناعي. في دراسة جديدة نُشرت على موقع arXiv، استكشف الباحثون كيف أن تلوث البيانات قد يصعب اعتباره عندما يختلف المحتوى المعرض له عن معيار التقييم.
قام الباحثون بتعريض أربع نماذج لغوية مفتوحة الوزن ترجمة معايير تقييم مثل MMLU وXQuAD إلى اللغة العربية بمستويات مختلفة من التعرض، وقياس أدائها على المهام الأصلية باللغة الإنجليزية. تمثل هذه البيئة المُتحكم بها إطاراً دراسياً لفهم كيفية تأثير الترجمة على عملية التلوث، بدلاً من مجرد إعادة بناء تسرب البيانات في العالم الحقيقي.
أظهرت النتائج الأولية أن أدوات كشف التلوث المصممة للغة الإنجليزية اختفت فعاليتها بشكل كبير في وجود الترجمة، مما يدل على أن وجود تأثيرات الترجمة قد يخفي الأثر الضار للتلوث. علاوة على ذلك، كان أداء النموذج في المهام باللغة الإنجليزية يتزايد عند تعرضه للمحتوى العربي، مما يشير إلى أن غياب إشارة التلوث لا تعني غياب تأثير الترجمة.
للكشف عن هذه التأثيرات، قدم الباحثون تقنية جديدة تُسمى "كشف التلوث الواعي بالترجمة (Translation-Aware Contamination Detection)"، والتي لا تعتمد على بيانات تدريب مسبقة، وتستند إلى ثبات التنبؤ عبر اللغات وإعادة ترتيب الخيارات.
تشير النتائج إلى أن الثبات عبر اللغات كان عالياً نسبياً عند مقارنته بقاعدة الاستقلال، مما يعزز الحاجة لتقنيات متعددة اللغات تهدف إلى توفير دلائل أكثر دقة حول سلوك التلوث في نماذج اللغة.
تأثير الترجمة على تلوث البيانات: دراسة جديدة من الأكاديميا
تكشف دراسة جديدة عن كيفية تأثير الترجمة على تقييم النماذج اللغوية، مما يسلط الضوء على مشكلة تلوث البيانات. النتائج تشير إلى أن الترجمة قد تخفي تأثيرات التلوث في الفحوصات باللغة الإنجليزية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
