في عالم الذكاء الاصطناعي، يُعتبر اكتشاف الشذوذ الصناعي (Industrial Anomaly Detection - IAD) من المجالات الحيوية التي تعزز من كفاءة العمليات الصناعية. ومع تطور نماذج الرؤية واللغة الكبيرة (Large Vision-Language Models - LVLMs)، أصبح بإمكان هذه النماذج تقديم أحكام دقيقة حول وجود شذوذات من خلال تحليل الصور.

ومع ذلك، كانت هناك تحديات عدة أمام الأساليب الحالية، حيث كانت النتائج تفتقر إلى الدقة في تحديد الشذوذات على مستوى البيانات البكسلية. هنا يتدخل الإطار الجديد OPD-IAD، والذي يهدف إلى تحسين دقة تحديد الشذوذ جنبًا إلى جنب مع استخدام اللغة كأداة إرشادية.

يعتبر OPD-IAD من الأطر الرائدة التي تعتمد على مفهوم
"التقطيع الذاتي في سياق الحكم" (On-policy Self-Distillation) مما يسهل تحقيق دقة أعلى من خلال دمج الأدلة الخاصة بالعيوب ضمن مسار الحكم الخاص بالنموذج.

من خلال طريقة جديدة تُعرف بـ "تثبيت الأنماط البصرية المدعومة لغويًا" (Language-guided Visual Anchoring)، يتمكن النموذج من إعادة ترميز الصور والأسئلة وفقًا للأحكام النهائية، مما يعزز قدرة النموذج على تحديد الشذوذ بصور أكثر دقة. تشير التجارب إلى أن إطار OPD-IAD يحقق أداءً متميزًا مقارنة بالأساليب الأخرى، حيث يتقدم على معظم المقاييس المتعلقة بالصورة والبيانات البكسلية.