يتزايد القلق في الأوساط الأكاديمية نتيجة لتحديات نماذج اللغات الضخمة (Large Language Models) وتأثيرها على النزاهة الأكاديمية ومراجعات الأقران. ومع ذلك، لا يزال اكتشاف الانتحال الناتج عن هذه النماذج يمثل مسألة غير مستكشفة بشكل كافٍ. التركيز السابق على اكتشاف النصوص المدرة بواسطة الذكاء الاصطناعي يتم غالبًا على الكشف عن المشاركة المسموح بها، تاركًا جانب إعادة استخدام المصادر دون معالجة فعالة.
في سعيهم لمواجهة هذه التحديات، قدم الباحثون نظامًا جديدًا يُعرف بـ Source-Conditioned Description-Length Gain (SCDG). يستند النظام إلى وجهة نظر طول الوصف في التنبؤ الاحتمالي، حيث يمكن للمعلومات الجانبية ذات الصلة تقليل طول شفرة تسلسل الهدف.
بدلاً من الاعتماد على التقنيات التقليدية ذات النمط القائم على التشابه، يميز SCDG بين طول الوصف لمستند مشبوه P، مع وبدون مصدر مرشح S. يوفر هذا التباين مكاسب في مستوى الرمز على مستوى التوكن، مما يقيس الأدلة التنبؤية الإضافية التي يقدمها المصدر S.
عند تقييم SCDG على معايير PAN في CLEF لاكتشاف الانتحال، أسفرت النتائج عن Precision بمعدل 0.92 وRecall بمعدل 0.97 وF1 بمعدل 0.94، متفوقة بذلك على جميع المعايير الأخرى؛ كما حقق في مهمة الاسترجاع المتعدد المصادر في PAN 2026 معدل nDCG@10 يبلغ 0.83 وRecall@100 بنسبة 0.96.
في اختبار Multi-News الذي يركز على حدث واحد، تمكن المصنف SCDG من التنبؤ بإعادة استخدام المصدر لعدد قليل جداً من الأزواج (فقط 0.125%). هذه النتائج تبرز قوة SCDG كنظام موحد وقابل للتفكيك على مستوى النجاح في إعادة استخدام المحتوى تحت التحولات الواسعة.
في النهاية، يعد SCDG خطوة دالة نحو تعزيز النزاهة الأكاديمية وضمان عدم استغلال نماذج الذكاء الاصطناعي في الأبحاث بشكل غير أخلاقي. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
اكتشاف الانتحال باستخدام الذكاء الاصطناعي: فحص جديد يغير قواعد اللعبة!
في مواجهة التحديات التي تثيرها نماذج اللغات الضخمة (LLMs) حول نزاهة الأوساط الأكاديمية، تم تقديم نظام مبتكر لاكتشاف الانتحال. يوفر النظام الجديد نتائج دقيقة ومدهشة في تحليل النصوص والتمييز بين المصادر.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
