في السنوات الأخيرة، شهدنا اعتمادًا متزايدًا على نماذج اللغات متعددة الوسائط (Multimodal Large Language Models - MLLMs) في المجالات الحيوية التي تتطلب أمانًا عاليًا. ولكن ومع هذا التقدم، تظهر العديد من المخاطر الضمنية التي قد تهدد سلامة التطبيقات.
المخاطر الضمنية هي تلك التي تظهر عندما تتقاطع العناصر النصية غير الضارة مع العناصر البصرية المحايدة منطقياً، مما قد يؤدي إلى مخرجات غير آمنة. وللأسف، فإن الطرق الحالية لاكتشاف هذه المخاطر غالباً ما تفشل في معالجة هذه القضايا لأنها تتجاهل الآليات الأساسية التي تنظم تفعيل المخاطر بين الموديلات.
في خطوة رائدة، قام الباحثون بتطوير "TriggerBench"، وهي أول مجموعة بيانات تركز على نمذجة التركيبية الخطرية، وتتضمن 5,600 حالة. من خلال عزل العناصر الرئيسية وعناصر التحفيز، تتمكن "TriggerBench" من إزالة بقايا المخاطر، مما يدفع النماذج إلى إجراء تخمين منطقي حقيقي بدلاً من مجرد مطابقة أنماط سطحي.
علاوة على ذلك، تقدم هذه الدراسة إطار عمل تدريبي يُعرف ب"Step-Supervised Structured Reasoning"، والذي يُستخدم لتدريب نموذج "ThinkingGuard" المتخصص. مُستلهمًا من نظرية الوعي بالوضعية، يقوم النموذج بفصل تحديد المخاطر الضمنية إلى مراحل معرفية متتابعة، ويستخدم خوارزمية "Monte Carlo Tree Search" لاستكشاف مسارات الاستدلال المثلى.
التجارب التي أُجريت عبر معايير السلامة القياسية والضمنية أظهرت أن "ThinkingGuard" يُحقق أداءً قويًا. للمزيد من المعلومات، يمكنكم زيارة GitHub الخاص بالمشروع.
هل تُعتقد أن هذه الابتكارات ستغير مستقبل التطبيقات الحيوية؟ شاركونا آراءكم في التعليقات!
ثورة الأمان في الذكاء الاصطناعي: كشف المخاطر الضمنية مع ThinkingGuard!
تمكن باحثون من تطوير نموذج ThinkingGuard الذي يكشف عن المخاطر الضمنية في نماذج اللغات متعددة الوسائط، مما يُعزز من أمان التطبيقات الحيوية. يهدف هذا الابتكار إلى تصحيح الأخطاء الناتجة عن التعلم السطحي في الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
