في عالم الذكاء الاصطناعي، تظل نماذج اللغة متعددة الوسائط (Multimodal Large Language Models - MLLMs) مثار اهتمام كبير، حيث تتمتع بفهم بصري قوي، ولكن يمثل التعرف على الميزات الداخلية التي تسبب هذه السلوكيات تحديًا كبيرًا. أعلنت مجموعة من الباحثين عن تطوير إطار عمل جديد يُعرف باسم MMDiff، الذي يهدف إلى تجاوز هذه التحديات.
يعمل إطار MMDiff من خلال استخدام مولدات حالية متعددة الوسائط (Sparse Autoencoders - SAEs) لتدريب النماذج بطريقة تعزز من إمكانية عزل الميزات وتحليلها. يقدم MMDiff ثلاثة جوانب رئيسية:
1. **عزل الميزات**: يتيح الإطار مقارنة النموذج الأساسي مع نظيرته المتعددة الوسائط، مما يساعد في تحديد الميزات التي تم تعديلها خلال عملية التدريب.
2. **كشف الميزات الخاصة بالمهام**: باستخدام تحليل تمييزي، يمكن عزل الميزات المسببة للرؤية البصرية.
3. **التحكم على مستوى الميزات**: يمكن إزالة أو توجيه الميزات المكتشفة بشكل مسبب، مما يسهل الحصول على سلوكيات محددة.
اختبر الباحثون نماذج متعددة الوسائط لثلاث عائلات من MLLMs، بما في ذلك LLaVA-MORE وPaliGemma 2 وInternVL3.5، وقاموا بتقييم النتائج المترتبة على الفهم البصري المكاني، والسلامة المتعددة الوسائط، وتحليل OCR. أظهرت النتائج أن MMDiff يمكن أن يكتشف ميزات محددة ترتبط بشكل قاطع بأداء النموذج، حيث انخفضت نسبة النجاح للهجمات على السلامة المتعددة الوسائط بنسبة 24% دون تأثير يذكر على الأداء في المهام الأخرى.
تعتبر هذه التطورات الخطوات الأولى نحو تحسين أدوات التفسير وزيادة سلامة النماذج، ما يفتح المجال أمام طرق جديدة للتحكم في سلوكات الذكاء الاصطناعي.
ما رأيكم في هذه التطورات الجديدة؟ هل ترون أن MMDiff يمكن أن يكون له تأثير حقيقي على مستقبل الذكاء الاصطناعي؟ شاركونا في التعليقات.
اكتشاف الميزات والتحكم بها: ثورة نماذج Diffing متعددة الوسائط في الذكاء الاصطناعي
تقدم MMDiff إطار عمل فريداً لاكتشاف ميزات نماذج اللغة متعددة الوسائط (MLLMs) والتحكم بسلوكها. من خلال استخدام SAE الموزع، يمكن عزل وتحليل الميزات للحصول على نتائج دقيقة وآمنة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
