في عالم الذكاء الاصطناعي، تتحول أنظمة كشف الحرائق التقليدية لتستخدم نماذج الرؤية واللغة (Vision-Language Models) التي تقدم قدرات جديدة في فهم السياقات الدلالية للمشاهد. ولكن، تواجه هذه النماذج تحديًا كبيرًا في حجمها الكبير والذي يجعل من الصعب استخدامها في أجهزة الاستشعار الصغيرة.

تتناول دراسة جديدة كيفية ضغط هذه النماذج المتخصصة في فهم الحرائق لتصبح مناسبة للتطبيق الكامل على الأجهزة المحلية، مما يضمن الحفاظ على السلوكيات الحرجة للسلامة.

في هذا الإطار، تم تطوير إطار عمل للتعليم بين المعلمين والطلاب حيث تُحول نماذج VLM الكبيرة، المخصصة لفهم الحرائق، إلى نماذج خفيفة الوزن. وتشير التجارب التي تمت على عدة عائلات من نماذج VLM وأحجام مختلفة إلى أن النماذج المختصرة تحتفظ بمعظم قدرات الفهم المتعلقة بالحرائق لنماذجها الأم.

تم نشر النماذج المدعومة على جهاز الكشف عن الحرائق التجاري Detectium، والذي تم تقييمه بدقة من حيث دقة المنطق، والكمون، واستخدام الذاكرة. وتوضح النتائج أن ضغط النماذج ونشرها يؤثران بشكل كبير ليس فقط على الدقة ولكن أيضًا على أنماط فشل النماذج، حيث أثبتت نسخة Qwen2.5-0.5B أنها الأفضل في تحقيق توازن بين الأداء والموارد.

توفر نتائج هذه الدراسة توجيهات واسعة حول كيفية نشر نماذج VLM المتخصصة في بيئات مأمونة وموارد محدودة، مما يفتح آفاقًا جديدة في مجال الذكاء الاصطناعي في تطبيقات السلامة.