في عالم الذكاء الاصطناعي، تجذب نماذج اللغة والرؤية المدمجة (Multimodal Models) الانتباه بشكل متزايد، وأحد أبرز هذه النماذج هو نموذج CLIP، الذي يُعتبر رمزاً للإبداع في دمج النصوص والصور. ومع ذلك، كانت هناك تحديات تتعلق بقدرته على تحديد العيوب الدقيقة بشكل فعّال. في هذا الإطار، تم اقتراح طريقة جديدة تعرف بـ"TED" (تحليل الأدلة على المحور النصي) لتعزيز فعالية نماذج الكشف عن العيوب.

تتجاوز طريقة TED استخدام نموذج CLIP بشكل تقليدي، حيث تقوم بتكييفه مع فحوصات إضافية لتحسين حساسية الكشف عن العيوب. ومع ذلك، أظهرت الأبحاث أن الحساسية العالية لا تعني بالضرورة فعالية موثوقة. فعندما تحدث تغييرات على نطاق المجال (Domain Shift)، تميل النماذج المعدلة إلى منح درجات عالية من الشذوذ لكل من العيوب الحقيقية والمناطق الطبيعية المعقدة بصريًا.

يقدم فريق البحث طريقة TED كوسيلة لتحليل الدعم لكل استجابة غامضة، ومعرفة ما إذا كانت مدعومة بشكل أفضل من قبل أجزاء العيوب المصدرية أو من قبل أجزاء طبيعية تم التعرف عليها عن طريق الخطأ كعيوب. يُظهر هذا الأمر كيفية عمل طريقة TED في مقارنة هذه السياسات تحت استجابة نصية عادية أو شاذة، دون الحاجة لتدريب على مجال الهدف، مما يوفر موارد كبيرة.

من خلال تطبيق TED على نماذج CLIP المدربة مسبقًا، أظهرت النتائج تحسنًا ملحوظًا في دقة تحديد العيوب على مستوى البكسل، مما قد يزيد من متوسط دقة التحديد من 5.0 إلى نحو 10.9 في البيئات ذات المنافسة العالية. تعزز هذه النتائج الفرضية القائلة بأن هناك أدلة على العيوب يمكن استرجاعها من تمثيلات متعددة النماذج المدربة مسبقًا، لكن الموثوقية تتطلب المزيد من التحليلات المتعددة.

سيقوم فريق البحث بإصدار الشيفرة المصدرية لطريقة TED على مستودع GitHub، مما سيوفر للباحثين والمطورين أدوات جديدة لمواجهة تحديات الكشف عن العيوب في التطبيقات المختلفة.