في ظل التقدم الكبير لنماذج اللغات الضخمة (Large Language Models) مثل VideoLLaMA2، أصبحت دقة تحليل الآراء في مجالات العلوم والتكنولوجيا موضوعًا ذو أهمية بالغة. تتطلب عملية استخراج الرأي (Opinion Extraction) الاستناد إلى الآراء الأساسية من تدفقات المعلومات الكثيفة، وهي مهمة تمثل تحديًا كبيرًا للنماذج التقليدية التي تعاني من صعوبة في تصفية الضوضاء وعدم موثوقية البيانات المهيكلة في بيئات متعددة اللغات والموديلات.

للتغلب على هذه المشكلة، تم اقتراح إطار عمل جديد لاستخراج الآراء الأساسية يعتمد على الأدلة المرئية كنقطة مرجعية لتقييم النصوص. يستخدم هذا الإطار نماذج VideoLLaMA2 وVideoLLaMA2.1 كأساس، حيث تم تطبيق تقنية التكيف المنخفض الرتبة الكمي (Quantized Low-Rank Adaptation - QLoRA) على مجموعة بيانات تم تنسيقها بعناية تحتوي على 2,194 عينة متعددة اللغات والموديلات.

تحت إعداد المعزز بالصورة، أثبت النموذج المُعدّل قدرته على إنتاج مخرجات آراء أساسية بتنسيق JSON منهي، محققاً دقة تبلغ 64.98% واسترجاع 42.15% ومعدل F1 قدره 51.14% ودقة على مستوى العينة وصلت إلى 74.00%. من اللافت للنظر أنه مقارنةً بإعداد VL2.1 بدون أي تدريب، فإن النتائج أظهرت زيادة ملحوظة في معدل F1 لعينات اللغة الإسبانية والروسية من 4.83% و0.45% إلى 46.05% و51.93% على التوالي.

كما يتضمن الإطار وحدة تصنيف ما بعد الاستخراج المستندة إلى نظرية الاحتمالات السلسة المجمعة (Fuzzy Cumulative Prospect Theory) لتقييم القيمة على مستوى الحالة، مما يوفر إشارة قيمة لتحليل البيانات ضمن إطار عمل استخبارات العلوم والتكنولوجيا (STI). إن التحسينات التي يوفرها هذا الإطار تمثل خطوة بارزة نحو تجاوز القيود الحالية في معالجة البيانات الضخمة، مما يفتح آفاقًا جديدة لمجالات البحث المستقبلية.