في عصر الذكاء الاصطناعي، أصبح من الضروري تطوير تقنيات تساعد المستخدمين على الاندماج بشكل أفضل مع بيئاتهم اليومية. هنا تأتي BuddyVQA، معيار مبتكر لمساعدات سؤال وجواب (QA) بأسلوب الرفيق يُركز على الفيديوهات الذاتية (egocentric streaming video). يتضمن BuddyVQA ما يصل إلى 21.6 ألف سؤال مرتبط بـ 6 آلاف لحظة بارزة عبر 1,012 فيديو ذاتي طويل.
تتضمن BuddyVQA ميزتين رئيسيتين يُلاحظ تقليديًا نقصهما في المعايير الحالية لمساعدات سؤال وجواب حول الفيديو: تعبيرات الإشارة الذاتية (ego-deictic expressions) والأسئلة المترابطة بشكل تفاعلي (interactively chained questions) مثل "أين هو؟" و"كيف أصل إلى هناك؟". تتطلب هذه الميزات من النماذج تحليل نية المستخدم في السياق المرئي ومحتوى سواله، مما ينقل بشكل كبير مستويات التفاعل والإدراك.
لمواجهة هذه التحديات، تم تقديم MyBuddy، مساعد سؤال وجواب أسلوبي يعزز من آلية التفكير المتسلسل متعددة الوسائط (multimodal chain-of-thought reasoning). يتيح للمساعد الوصول إلى الإجابات النهائية بناءً على تاريخه مع الأسئلة السابقة ومحتوى الفيديو المرئي. كما تم تصميم مرشح أسئلة إضافي وذاكرة متعددة المستويات لتحسين كفاءة البحث عن المعلومات المرئية.
أثبتت التجارب أن MyBuddy يُعزز بشكل كبير أداء نماذج الذكاء الاصطناعي الأساسية على BuddyVQA. علاوة على ذلك، تتجلى هذه التحسنات لتشمل معايير أخرى لمساعدات سؤال وجواب حول الفيديو، مما يبرز فعالية نهجنا. يُمكنكم استكشاف الشفرة المصدرية ومجموعة البيانات المتاحة على GitHub.
ما رأيكم في هذا التطور؟ هل تعتقدون أن مثل هذا النوع من المساعدات يمكن أن يُحدث فرقًا في حياتنا اليومية؟ شاركونا في التعليقات.
باستخدام الذكاء الاصطناعي: مساعدات سؤال وجواب بأسلوب الرفيق من BuddyVQA
تقدم BuddyVQA معياراً جديداً لمساعدات سؤال وجواب تركز على الفيديوهات الذاتية، مما يعزز من فعالية نماذج الذكاء الاصطناعي عبر استخدام أسئلة مترابطة. التفاعل مع محتوى الفيديو أصبح أكثر ذكاءً وفعالية مع تطبيق MyBuddy.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
