في عالم التكنولوجيا الحديثة، يسعى الباحثون دائماً لتطوير أنظمة ذكية قادرة على التعامل مع تحديات جديدة. يتناول هذا المقال الإطار الجديد SAFE-G، الذي يركز على تحسين أداء أنظمة الإجابة على الأسئلة من خلال دمج المعلومات المرئية والمعرفية.

تستهدف تقنيات الإجابة على الأسئلة البصرية المعرفية (KB-VQA) معالجة الاستفسارات التي تتطلب التفكير عبر مصادر معلومات خارجية، إضافةً إلى المحتوى المرئي. عادةً ما تعتمد الطرق الحالية على دمج الميزات متعددة الأنماط لاسترجاع المعلومات الخارجية، ومن ثم استعمال **نماذج اللغات الضخمة متعددة الأنماط** (Multimodal Large Language Models - MLLMs) لإنتاج الإجابات. ومع ذلك، تواجه هذه الطرق صعوبات في التقاط الروابط الهيكلية داخل السياقات المعقدة، مما يؤثر سلباً على قدرتها على تصفية الضوضاء، كما أنها تفشل أحيانًا في ضمان أن يظل عملية التفكير وفية لما تم استرجاعه من أدلة.

لذا، تم اقتراح SAFE-G كإطار جديد مصمم لتحقيق التوازن بين التحديد الدقيق للأدلة والعملية الفكرية الموثوقة. يعتمد هذا الإطار على استرجاع هجين ذو دقة منخفضة يدمج بين الأنماط المرئية والنصية لاستدعاء الوثائق المرشحة. بعدها، يتم تطبيق استرجاع هيكلي دقيق يعكس الاعتماد الهيكلي لتصفية الضوضاء والتموقع بدقة.

بالإضافة إلى ذلك، تم إدخال استراتيجية التعلم التعزيزي (Reinforcement Learning - RL) مع مكافأة تعتمد على الأدلة تعطي نقاطاً للإجابات الصحيحة فقط إذا كانت الأدلة المختارة صائبة. هذا الالتزام الصارم بالترابط يدفع النموذج ليقوّم استجابته في السياق المسترجع، مما يزيد من فعاليته في تحديد الأدلة عبر الميزات متعددة الأنماط وتقديم استدلال موثوق.

أظهرت التجارب الشاملة على مجموعتي بيانات Encyclopedic-VQA وInfoSeek أن إطار SAFE-G تفوق على الطرق السابقة بفارق 8.9% و3.5%، مما يعزز دقة الاستدلال بشكل كبير.

لمزيد من التفاصيل، يمكنكم زيارة المشروع مفتوح المصدر على GitHub: [رابط_المقال].