في عالم الذكاء الاصطناعي، يزداد الاعتماد على نماذج اللغات متعددة الأنماط (Multimodal Large Language Models) بشكل متزايد، ومن المؤكد أن هذه النماذج تمتلك إمكانيات قوية في التعلّم الشامل للتمييز بين الأنماط المختلفة من البيانات. إلا أن الأساليب الحالية كانت تواجه تحديات مثل ضغط المدخلات إلى مفهومات بسيطة أو الحفاظ على سلاسل طويلة من المتجهات البصرية، مما يؤدي إلى تكاليف تخزين وتفاعل عالية.
هذا ما دفع الباحثين لتقديم نموذج **ResComEmb**، إطار عمل تدريبي ثوري يهدف إلى تحقيق تمثيلات متعددة المتجهات بشكل فعّال. يقوم النموذج أولاً بتشفير كل مدخل بدقة ديناميكية، مما يتيح له التقاط تفاصيل دقيقة من البيانات. ومن ثم، بعد عملية تكييف من نموذج اللغات متعددة الأنماط، يعمل على تقليل التكرار من خلال وحدة ضغط التماثل المتبقية (Residual Homogeneity Compression) التي تمكّن من تقليل التداخل والتكرار عمومًا.
بالإضافة إلى ذلك، يقوم ResComEmb بإضافة آلية تطابق متأخّر ثنائي الاتجاه (Bidirectional Late-Interaction Matching) تعزز من فعالية تقييم استعلامات الوثائق من خلال حساب متوسط النقاط القوية لكل توكن في كلا الاتجاهين. وهذا يسمح بتحقيق توازن مدهش بين الفعالية والكفاءة.
لقد أظهرت التجارب على عدة مجموعات بيانات مثل **MMEB** و**ViDoRe V1** و**ViDoRe V2** أن ResComEmb يحقق تمثيلات بيانات متعددة الأنماط ذات جودة أعلى مقارنة بالنموذج السابق **VLM2Vec-V2** ويفوق نتائج **ColQwen2.5** بشأن استرجاع الوثائق البصرية باستخدام 37.5% فقط من ميزانية التوكن البصري.
لا شك أن هذه الابتكارات تعكس تقدمًا كبيرًا في كيفية معالجة البيانات متعددة الأنماط وتفتح المجال أمام المزيد من التطبيقات في مختلف المجالات. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
ثورة في التعلم متعدد الأنماط: اكتشف ResComEmb لتحسين تمثيلات البيانات!
يقدم نموذج ResComEmb طريقة جديدة وفعّالة للتعلم متعدد الأنماط من خلال تقنيات ضغط مبتكرة. التجارب تثبت تفوقه في تحسين تمثيلات البيانات متعددة الأنماط مقارنة بالنماذج الأخرى.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
