في عصر المعرفة الرقمية المتزايدة، تبرز الحاجة إلى أساليب جديدة لتحسين وصول المعلومات وفهمها. تعلن ورقة بحثية جديدة على موقع arXiv عن تطوير طريقة مبتكرة لبناء شبكة معرفة متعددة الوسائط (Multimodal Knowledge Graph) تعتمد على الأدلة، تستهدف تعزيز التعليم من خلال تحليل محاضرات الفيديو.

تعتمد العملية على معالجة مجموعة غنية من البيانات، بما في ذلك الصوت والنصوص المعروضة والرسومات والمعادلات. يتم ذلك عبر مسارات متعددة تجمع بين تحويل الكلام إلى نص (Speech-to-Text) وتطبيق تقنية التعرف الضوئي على الأحرف (OCR) لاستخراج النصوص والصور.

يستفيد نظام التعليم المعتمد على هذه الشبكة من نموذج رؤية-لغة (Vision-Language Model) لاختيار المفاهيم والعلاقات المدعومة بالأدلة النصية أو البصرية، مما يضمن أن المعلومات المستخرجة صحيحة. وقد تم معالجة 3,118 إطارًا من المحاضرات، مع التركيز على 1,022 مفهوماً و312 علاقة، مما أدى إلى توفير 172 مفهومًا قياسيًا و282 علاقة تغطي 90.38% من نقاط البيانات.

تظهر النتائج الأولية لاختبار الاسترجاع المكون من ثلاثة أسئلة دقة مذهلة تقدر بـ100% في الدرجات العليا مما يعكس قوة هذه الطريقة الجديدة. بدلاً من الادعاء بالأداء المتفوق، تقدم هذه الورقة منهجية تعتمد على التحقق والمعاينة، مما يجعلها مساهمة قيمة في مجال التكنولوجيا التعليمية.

هل تعتقد أن هذه التقنيات ستحدث ثورة في التعليم؟ شاركونا آراءكم في التعليقات!