في عالم يعتمد بشكل متزايد على الذكاء الاصطناعي، تثبت أنظمة الإجابة عن الأسئلة متعددة النماذج (Multimodal Question Answering) أنها أحد أهم الأدوات في مجال معالجة المعلومات. في هذا الإطار، قدم الباحثون مؤخرًا نموذجًا جديدًا يسمى SKIP (Salient Knowledge-Injected Pathways)، الذي يعد ثورة في كيفية معالجة الأسئلة المتعلقة بمحتوى بصري ومعرفي مكثف.
يقع KI-MMQA (Knowledge-Intensive Multimodal Question Answering) في وسط ثلاث عمليات مكلفة: تسلسلات الرموز البصرية الطويلة، الاسترجاع الكثيف من مجموعات خارجية كبيرة، والتكامل الشامل بين النماذج. بدلاً من دفع كل هذه التكاليف بشكل موحد لكل استعلام، يحسن نموذج SKIP العمليات من خلال توجيه الحسابات على مسارات مختصرة تعتمد على السؤال والصورة وتقديرات الصعوبة.
يوفر SKIP مزيجًا فريدًا من عدة تقنيات، منها: تقليم الرموز البصرية الموجهة بالسؤال، الاسترجاع المتناثر الشرطي على المناطق، الانتباه المتبادل المتناثر، والتحقق الاستباقي من المعرفة، بالإضافة إلى وحدة تحكم ميزانية تتكيف مع صعوبة السؤال المتوقع. هذا يعني أن هذا النموذج ليس فقط أكثر كفاءة، بل أيضا يقدم دقة محمية تحت قيود كمية المعلومات.
اختبر الباحثون سعة النموذج عبر خمسة معايير OK-VQA، A-OKVQA، InfoSeek، Encyclopedic-VQA، وViQuAE، لتظهر النتائج أن SKIP يحقق أو يتجاوز دقة الأنظمة التقليدية الكثيفة، من خلال استخدام ما بين 3.4 إلى 6.8 مرات أقل من FLOPs، وكذلك تقليل زمن الانتظار النهائي بمقدار 2.7 مرة.
يمكنكم الاطلاع على التعليمات البرمجية كاملة هنا: [رابط SKIP].
كيف ترون هذا التطور في أنظمة الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
طرق المعرفة البارزة: استكشاف فعال لأسئلة متعددة النماذج بفضل SKIP الثورية
تقدم SKIP نموذج استدلال موحد يهدف إلى تحسين أداء أنظمة الإجابة عن الأسئلة بواسطة تقنيات متعددة النماذج. يعتمد هذا النموذج الفريد على تخفيض غير مسبوق في التكاليف الحسابية، مما يضمن دقة أعلى واستخدام موارد أقل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
