في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة متعددة الوسائط (MLLMs) ثورة تقنية تتعامل مع فهم الفيديوهات الذاتية الملتقطة بواسطة الأجهزة القابلة للارتداء. إلا أن استخدام هذه النماذج يواجه تحديًا بسبب القيود الميزانية على عدد الرموز (tokens) التي يمكن معالجتها. إذ أن الذاكرة وتكاليف الحوسبة تتزايد بسرعة مع زيادة عدد الرموز البصرية، ما يجعل معالجة الفيديو عالي الدقة أمرًا باهظ الكلفة، خاصة عند نقل البيانات بشكل كبير.

أحد الحلول السابقة، المعروف باسم GazeLLM، يقوم بقص الفيديو بناءً على نظرة حامل الكاميرا، مما يقلل عدد الرموز البصرية بنحو عشرة أضعاف مع الحفاظ على أو تحسين جودة الأوصاف كاملة الدقة. وعلى الرغم من فعالية هذه الاستراتيجية، فإن استخدامها يتطلب أجهزة تتبع العين المتخصصة، غير المتاحة في النظارات الذكية التجارية.

هنا يأتي دور EgoGazeLite كبديل برمجي مبتكر يعمل دون الحاجة إلى أجهزة إضافية. تم تصميمه كمن Predictor خفيف الوزن يمتاز بعملية مزدوجة لتوقع النظر في الفيديوهات الذاتية. تم إجراء تجارب شاملة باستخدام نموذجين من MLLMs، وثلاث مقاييس تلقائية، وحكمين من LLM. وأظهرت النتائج أن قصوص النظر المتوقعة لا تختلف بشكل كبير عن قصوص النظر الحقيقية، مما يؤكد تماسك النتائج عبر جميع الحالات.

تتميز EgoGazeLite بأنها تحقق هذا التقدم باستخدام 15.7 مليون باراميتر و6.71 GFLOPs، وقدرتها على تشغيل خط معالجة النظر والقص بالكامل في الزمن الحقيقي (21.6 مللي ثانية لكل إطار) على أجهزة تسريع مستهلكة. هذه النتائج تعني أن عملية فهم الفيديو الذاتي الذي يعتمد على النظر أصبحت ممكنة دون الحاجة إلى أجهزة تتبع العين، مما يعزز الأداء والكفاءة في استخدام نماذج اللغة متعددة الوسائط.