تشهد نماذج اللغة والرؤية (Vision-Language Models) تقدمًا مثيرًا في فهم المشاهد على مستوى الصور. لكن، ماذا عن معالجتها لمقاطع الفيديو الطويلة ذات المنظور الشخصي؟ كثيراً ما تواجه هذه النماذج صعوبة في الاحتفاظ بذاكرة دائمة أو تمثيل مكاني واضح. ولحل هذه المشكلة، تم تقديم إطار عمل جديد يُدعى VL-KnG، والذي يعتمد على إنشاء رسوم بيانية معرفية زمانية ومكانية من مقاطع الفيديو الفردية.
ما يُميز هذا النظام هو أنه لا يتطلب التدريب المسبق، بل يقوم بمعالجة الفيديو على شكل قطع صغيرة، مما يساعده في الحفاظ على هويات الأجسام من خلال تقنية جديدة تدعى Asociative بناءً على نماذج اللغة الكبيرة (LLM) وتقديم إجابات دقيقة من خلال استرجاع مُعزز بالرسم البياني (Graph-Enhanced Retrieval).
أثبتت الاختبارات على ثلاثة مؤشرات للإجابة على الأسئلة (OpenEQA، NaVQA، و WalkieKnowledge) أن VL-KnG يتمتع بدقة تنافس نماذج اللغة والرؤية المتقدمة، بينما يبقى زمن الاستجابة أقل بكثير. وهذا يجعل منه خيارًا فعالًا للإجابة عن الاستفسارات بشكلٍ سريع مع استدلالات واضحة تعتمد على الرسوم البيانية.
أظهرت التجارب مع إحدى الروبوتات العملية التطبيقية للنظام، حيث بقي زمن الاستجابة ثابتًا حتى مع زيادة طول تاريخ الملاحظة. لذا، يُعد VL-KnG ذاكرة مشهدية دائمة يمكن استدعاؤها، مما يفتح آفاقًا جديدة لصيانة المعرفة وتحديثها في وكلاء الذكاء الاصطناعي. هذا الابتكار ليس مجرد تطوير تقني، بل خطوة هامة نحو مستقبل أكثر ذكاءً وتفاعلاً. فماذا تعتقدون عن هذا التطور؟ شاركونا آرائكم في التعليقات.
نظام VL-KnG: ثورة في الذاكرة المشهدية الذكية لأجهزة الذكاء الاصطناعي
تقدم أبحاث جديدة إطار عمل مبتكر يُدعى VL-KnG، الذي يربط بين الرسوم البيانية المعرفية الزمانية والمكانية لتحسين أداء نماذج الذكاء الاصطناعي في الإجابة على الأسئلة المتعلقة بمقاطع الفيديو. يحقق النظام دقة عالية مع تقليل كبير في زمن الاستجابة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
