في السنوات الأخيرة، باتت معالجة عدم توازن البيانات من المواضيع الساخنة في مجالات التعلم الآلي والذكاء الاصطناعي. تقوم هذه الدراسة بتسليط الضوء على مدى فعالية الأساليب المتبعة في هذا السياق، وتحديدًا على النتائج المستخلصة من استخدام مجموعة بيانات واحدة فقط.
قامت الدراسة ببحث متأني على مجموعة بيانات البطاقات الائتمانية المخادعة المتاحة على منصة كاجل (Kaggle)، حيث تم اتباع بروتوكول تقييم يعتمد على عملية التحقق المتداخل (nested cross-validation) لضمان عدم تسرب المعلومات. ومن خلال هذا المنهج، تم التحقق من أداء نموذج الغابة العشوائية (Random Forest) عند العتبة الافتراضية 0.5، وطرحت الدراسة تساؤلات حول مدى جدوى ضبط العتبة في معالجة عدم توازن البيانات.
عند النظر إلى 45 مهمة ثنائية مختلفة تتنوع فيها نسب عدم التوازن بين 1:1.5 إلى 1:178، اتضح أن الفائدة الحقيقية لضبط العتبات تنكشف. إذ وجدت النتائج أن الغابة العشوائية تحقق أفضل استفادة من عملية ضبط العتبات بزيادة في قيمة F1 بلغت +0.101. بينما أثبتت طريقة SMOTE أنها تحسن من الأداء عبر الطيف، لكن أظهرت نتائج متضاربة في مجموعة بيانات الاحتيال.
علاوة على ذلك، تتضمن الدراسة نتائج مفاجئة حول تأثير النسبة غير المتوازنة على فوائد ضبط العتبات، حيث اكتُشفت موجات في الفائدة عند نسب مختلفة.
أخيرًا، تطلق الدراسة بروتوكولها وأدواتها لجميع الباحثين في هذا المجال، مما يسهل على الآخرين تكرار تجاربهم ودعم تقدم أبحاث الذكاء الاصطناعي في معالجة عدم توازن البيانات.
فشل نتائج البيانات المفردة: دراسة شاملة لطرق ضبط العتبات وإعادة التشكيل في تصنيف غير المتوازن
تستعرض الدراسة كيف أن الاعتماد على مجموعة بيانات واحدة لاستنتاجات معالجة عدم توازن البيانات يُعتبر ممارسة غير آمنة. تكشف النتائج أهمية ضبط العتبات عبر 45 مهمة تصنيف مختلفة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
