تعتبر النماذج الأساسية الجدولية (Tabular Foundation Models) أداة فعالة يتم تدريبها مسبقاً على مجموعات ضخمة من المهام الاصطناعية المولدة بشكل إجرائي. ومع ذلك، لا يزال من غير الواضح مدى كفاءة هذه البيانات الاصطناعية المسبقة في دعم المهام العملية التي يتم تقييم النماذج بناءً عليها. تهدف هذه الدراسة إلى تسليط الضوء على هذا الجانب من خلال منظور مستوى التوزيع.

تبدأ الدراسة بإعادة إنشاء مولدات البيانات الاصطناعية لأربع نماذج أساسية جدولية، حيث تتم مقارنة المهام المولدة بواسطة هذه المولدات مع مجموعات بيانات من معيارين جدوليين معتمدين يتم استخدامهما بشكل واسع. تمثل كل مجموعة بيانات من خلال مجموعة شائعة من الوحدات الهيكلية التي تلتقط أنماط البيانات، الهيكليات، وتوزيعات الميزات والعلاقات بين الميزات والاستجابات.

تقوم الدراسة بقياس مدى التغطية الهيكلية التي تصل إليها كل أولوية اصطناعية مقارنة بالمهام المرجعية باستخدام معايير مبتكرة. تعكس النتائج الكبرى الفروقات الجوهرية بين أولوية البيانات الاصطناعية، حيث توفر بعض المولدات دعماً أوسع وأكثر كثافة للمهام المرجعية مقارنة بالآخرين. علاوة على ذلك، يرتبط الدعم الأقوى بين البيانات الاصطناعية والمهام المرجعية عادةً بأداء تنبؤي أفضل للنماذج.

هذه النتائج تؤكد أهمية التغطية الهيكلية كتشخيص مفيد لتوصيف أولوية البيانات الاصطناعية وربط الافتراضات حول كيفية توليد البيانات بسلوك النموذج اللاحق. في هذا السياق، ماذا تعتقدون حول اعتماد نماذج البيانات الاصطناعية في التدريب؟ هل ترون أنها تعطي نتائج فعالة في المهام العملية؟ شاركونا آرائكم!