في عالم الإنترنت، حيث تتداخل الميمات مع إشارات بصرية ومحتوى نصي وسياقات ثقافية، تصبح هذه العناصر تحديًا حقيقيًا في حال وجود الفكاهة والسخرية والنوايا الضارة في نفس الوقت. لهذا السبب، أصبح من الضروري وجود أنظمة قادرة على تفسير الميمات بشكل موثوق ومفهوم.

تقديم إطار العمل MAR-12 يمثل خطوة جديدة في هذا الصدد، حيث يعتمد على نماذج اللغة والرؤية (Vision Language Models - VLMs). تم تصميم هذا الإطار لتحليل الميمات وفهم العناصر الفكاهية والضارة التي قد تظهر فيها.

تتمثل وظيفة MAR-12 في تفسير كل ميم من خلال اثني عشر منظورًا مختلفًا مستمدًا من نظريات الفكاهة والكراهية، مما يمكن النظام من تقييم المحتوى بشكل أكثر دقة. بالإضافة إلى ذلك، يستخدم الإطار آلية انتباه مدروسة لتحديد مدى تأثير كل منظور على التوقعات النهائية. هذا يساعد في تقديم تفسيرات شاملة ومتسقة، مما يزيد من شفافية النظام.

أظهرت التجارب على مجموعات بيانات PrideMM وMemotion أن MAR-12 يحقق دقة تصل إلى 80.3% في الكشف عن الفكاهة و75.9% في الكشف عن الكراهية، متفوقًا بذلك على الأنظمة الحالية. كما أظهرت التقييمات من قبل البشر ونماذج الذكاء الاصطناعي مثل GPT-4 أن MAR-12 يحقق تفسيرات متسقة ومقنعة، خصوصًا في حالة الميمات التي تحتوي على إشارات فكاهية وضارة في آن واحد.

في النهاية، يمثل MAR-12 انتقالًا كبيرًا في فهم الميمات في العصر الرقمي، مما يساعد في التمييز بين الفكاهة الآمنة والفكاهة الضارة ويعزز من القدرة على تحليل المحتويات بشكل أكثر دقة.