في عالم تصميم النماذج باستخدام CAD، يتم الاعتماد على النماذج الجنرالية (Generative CAD models) لتظل تصرفاتها صحيحة بعد إجراء تعديلات على المعايير. ينظر الباحثون إلى زيادة عدد التحقق من التعديلات كطريقة مباشرة للحصول على تقييمات موثوقة. ومع ذلك، تحت ميزانية محددة، قد يؤدي التدقيق الأكثر شمولاً إلى تقليل عدد المهام والتوليد المستقل الذي يمكن تقييمه، مما قد يجعل تقديرات النموذج أقل دقة.

تستعرض دراسة DepthBenchCAD هذه الظاهرة، وتبدأ بتفكيك تقييم السلوك إلى ثلاثة مستويات من الأدلة: قوالب المهام، التوليدات العشوائية، والتعديلات داخل البرنامج. وتعرف الدراسة متوسط خطر الفشل الذي لا يتغير بتغير عمق التدقيق. من خلال دمج تباين المستويات الثلاثة مع تكاليف التنفيذ المقاسة، يتم تحليل التوازن بين التدقيق العميق والتغطية المستقلة الواسعة.

أظهرت التجارب في بيئتين من بيئات CAD وخمسة أنظمة توليد أن قيمة التدقيق العميق تعتمد على مصدر عدم اليقين في التقييم. عندما تهيمن التباينة في القوالب أو عشوائية التوليد، يمكن أن تزيد إضافات التحقق من التعديلات من خطأ التقدير الكلي. في حال كانت التباينات داخل البرنامج كبيرة وتكون التوليدات مكلفة، يكون التدقيق العميق أكثر قيمة.

تشير التقديرات المتعلقة بالتباين والتكاليف المستخلصة من المعايرة إلى اتجاه هذه التغييرات وتوفر أساسًا تشخيصيًا لتوزيع الأدلة على المهام المحتفظ بها، مما يسهل اتخاذ القرار بشأن توجيه الميزانية نحو مهمة جديدة، توليد جديد، أو المزيد من التحقق من التعديلات.

في الختام، توضح هذه النتائج أن شمولية فحص البرنامج قد تتباين مع موثوقية تقييم النموذج، مما يثير تساؤلات حول كيفية تحسين عمليات التدقيق في النماذج المستقبلية. فهل تعتقدون أن التدقيق العميق هو الطريق الأفضل لتعزيز موثوقية النماذج؟ شاركونا آرائكم في التعليقات!