أصبح التدريب على نماذج الرؤية الحاسوبية المعاصرة يتطلب الاعتماد على مجموعات بيانات موسعة وموثقة، وخاصةً في مجالات حيوية مثل مراقبة سلامة البناء، حيث تزداد تكاليف جمع البيانات وتعقيداتها. قدمت ورقة بحثية حديثة دراسة ممنهجة تقارن بين اثنين من paradigms لتوليد البيانات التدريجية: محاكاة Unity (Unity Simulation) والتوليد القائم على التحكم (Controllable Diffusion-based generation).

تُعد هذه الدراسة مهمة للغاية نظرًا لقلة البيانات المتاحة في بعض الظروف الحقيقية. وقدمت إطار عمل تجريبي موحد يسمح بخلط مجموعات البيانات من مصادر حقيقية، ومحاكية، ووليدة مع الحفاظ على إعدادات النماذج والتدريب نفسها.

في التقييم الكمي، أظهرت النتائج أن استخدام كل من المحاكاة والتوليد منفردين لم يحقق الأداء الأمثل، حيث كان تدريب نماذج فقط على المحاكاة يوصل إلى انخفاض بنسبة 50% في متوسط الدقة (mAP) مقارنةً بالبيانات الحقيقية. لكن من الناحية الأخرى، أظهرت طريقة التوليد القائمة على التحكم انخفاضًا طفيفًا في النتيجة بنسبة 16.5%.

ومن خلال تجميع البيانات، أظهرت النتائج تحسنًا كبيرًا في الأداء، حيث أدت تكوينات 90% حقيقية + 10% من Unity إلى أفضل نسبة mAP تصل إلى 62.68%، بينما تكوين 90% حقيقية + 10% من CIA سجل أعلى دقة بنسبة 74.45%.

نتائج هذه الدراسة توضح أن الاستخدام المحدود للبيانات الاصطناعية يُعزز من القدرة على التعميم، بينما يؤدي الاستبدال المفرط إلى انحراف نحو مجال محدد. لقد أظهرت هذه الدراسة كيف أن الدمج الذكي بين تقنيات محاكاة Unity وطرق التوليد الجديدة يمكن أن يحدث فرقًا كبيرًا في دقة الأنظمة الذكية.