في عالم الذكاء الاصطناعي، تلعب نماذج الرؤية اللغوية بالإشعاع (IR-VLMs) دوراً حاسماً في إدراك المعلومات الحرارية، حيث تمتد قدراتها إلى تصنيف الكلمات المفتاحية وصياغة التعليقات المرئية والاستجابة للأسئلة. رغم ذلك، لا تزال هذه النماذج تعاني من ضعف استقرارها تجاه الاضطرابات الحرارية الهيكلية ومواءمتها السريعة للمدخلات المتنوعة.

للتغلب على هذه التحديات، تم تقديم QR-Structured Thermal Triggers (QR-STT) كإطار عمل سري وخالي من التدريب، يهدف إلى توجيه الهجمات بشكل دقيق على نماذج IR-VLMs. يركز هذا الإطار على الحفاظ على المناطق الوظيفية لنمط QR مع تحسين المكونات الداخلية المخصصة لدرجات حرارة منخفضة، محايدة، أو عالية.

تشمل الخصائص المتقدمة للإطار البحث المشترك في التوبولوجيا للمكونات ومعلمات العرض، مثل الموضع، والنطاق، والدوران، والشدة، والتشويش، والدائرية. يتم تنفيذ إجراء ثلاثي المراحل بدون تدرج، مع تكرار ذكي لمكونات الهجوم، مما يسهل التعامل مع فضاء البحث المختلط.

تجارب محفوظة على عدة مكونات من نوع CLIP أظهرت أن QR-STT يمكن أن يوجه التنسيق بين الصورة والنص نحو مفاهيم مختارة، مع الحفاظ على السرية البصرية. رغم ذلك، فإن هذه الاضطرابات المحسنة للتصنيف تنتقل أيضاً إلى صياغة التعليقات البصرية (image captioning) والاستجابة للأسئلة المرئية (Visual Question Answering - VQA)، مما يتسبب في انحراف دلالي متسق نحو الأهداف المحددة.

تسلط هذه النتائج الضوء على نمط QR-Structured الحراري كسطح هجوم قابل للتفسير لأغراض الرؤية الحرارية المدعومة باللغة، ما يبرز الحاجة الملحة لتقييم القوة ضد الهجمات الدلالية عبر المهام المختلفة.