تحظى البيانات الجدولية المُصنعة بأهمية كبيرة في العديد من المجالات، خاصة عندما يتعلق الأمر بالحفاظ على توزيع الأعمدة وتفاعلاتها. ولكن كما أوضح بحثنا الجديد، فإن معظم المعايير المستخدمة لتقييم هذه البيانات غير قادرة على التقاط الاعتماد الحقيقي بين الأعمدة، مما يؤدي إلى قيود كبيرة في تطبيقات مثل كشف الاحتيال وتقييم المخاطر السريرية.

يقدّم البحث طريقة جديدة تشخيصية تعتمد على تحليل الاعتماد بين الأعمدة، حيث يستخدم اختبار العينة المزدوجة المستند على المصنف المدعوم بالنموذج الذكي (XGB-C2ST). هذا الاختبار يقيم البيانات عبر مكونات متعددة، متضمنة الاعتماد والتوزيع، مما يتيح تقديراً أدق للفجوة الموجودة بين البيانات الجديدة والبيانات الحقيقية.

من خلال تطبيق هذه التقنية على نماذج التوليد المتطورة مثل (TabbyFlow/EF-VFM) و(TabDiff)، تمكنا من تسليط الضوء على فجوة الاعتماد التي لم تُكتشف بعد والتي تؤثر على أداء الفئات القليلة. وللأسف، لا يمكن للإصلاحات التقليدية مثل زيادة السعة أو التصحيحات اللاحقة أن تسد هذه الفجوة، مما يشير إلى أن الأمر يتطلب المزيد من التشغيل الفعلي وإشراف مباشر على الاعتمادية لتحقيق نتائج أفضل.

بهذا الشكل، يؤكد البحث على أهمية تطوير نماذج توليد بيانات أكثر وعيًا بالاعتماد، لضمان تحقيق أقصى فائدة من الفئات القليلة التي تُعتبر حرجة في المجتمع.