في عالم يعتمد بشكل متزايد على الذكاء الاصطناعي، تثبت أنظمة الإجابة عن الأسئلة متعددة النماذج (Multimodal Question Answering) أنها أحد أهم الأدوات في مجال معالجة المعلومات. في هذا الإطار، قدم الباحثون مؤخرًا نموذجًا جديدًا يسمى SKIP (Salient Knowledge-Injected Pathways)، الذي يعد ثورة في كيفية معالجة الأسئلة المتعلقة بمحتوى بصري ومعرفي مكثف.

يقع KI-MMQA (Knowledge-Intensive Multimodal Question Answering) في وسط ثلاث عمليات مكلفة: تسلسلات الرموز البصرية الطويلة، الاسترجاع الكثيف من مجموعات خارجية كبيرة، والتكامل الشامل بين النماذج. بدلاً من دفع كل هذه التكاليف بشكل موحد لكل استعلام، يحسن نموذج SKIP العمليات من خلال توجيه الحسابات على مسارات مختصرة تعتمد على السؤال والصورة وتقديرات الصعوبة.

يوفر SKIP مزيجًا فريدًا من عدة تقنيات، منها: تقليم الرموز البصرية الموجهة بالسؤال، الاسترجاع المتناثر الشرطي على المناطق، الانتباه المتبادل المتناثر، والتحقق الاستباقي من المعرفة، بالإضافة إلى وحدة تحكم ميزانية تتكيف مع صعوبة السؤال المتوقع. هذا يعني أن هذا النموذج ليس فقط أكثر كفاءة، بل أيضا يقدم دقة محمية تحت قيود كمية المعلومات.

اختبر الباحثون سعة النموذج عبر خمسة معايير OK-VQA، A-OKVQA، InfoSeek، Encyclopedic-VQA، وViQuAE، لتظهر النتائج أن SKIP يحقق أو يتجاوز دقة الأنظمة التقليدية الكثيفة، من خلال استخدام ما بين 3.4 إلى 6.8 مرات أقل من FLOPs، وكذلك تقليل زمن الانتظار النهائي بمقدار 2.7 مرة.

يمكنكم الاطلاع على التعليمات البرمجية كاملة هنا: [رابط SKIP].
كيف ترون هذا التطور في أنظمة الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!