يشهد عالم الذكاء الاصطناعي خطوة جديدة ومتقدمة بفضل النموذج الثوري Watch-Think-Interact (WTI)، والذي يهدف إلى تعزيز التفاعل مع مقاطع الفيديو المعقدة عبر نظام تفكير ذكي. تعتمد هذه المنظومة على إمكانية الإجابة عن أسئلة غير متزامنة تتعلق بتفاصيل تم ملاحظتها مسبقاً، مما يسمح بفهم أعمق لسياق المحتوى المرئي.
النموذج الجديد WTI يقوم بتخزين معلومات مركّزة عن مقاطع الفيديو وكأنها مذكرات نصية طبيعية مرتبطة بفترات زمنية محددة، مما يُمكّن من استرجاع التفاصيل المرئية عند الحاجة. في كل مرة يُطرح فيها سؤال، يستخدم WTI الذاكرة الحالية للإجابة متى ما كانت المعلومات كافية، أو يتابع المشاهدة للحصول على أدلة إضافية. في حالة عدم توافر المعلومات الضرورية، يقوم النموذج باستدعاء فترات زمنية سابقة ذات صلة ويقرر كيفية الرد بعد دمج هذه الإدخالات الجديدة.
وقد طُوِّر النموذج باستخدام قاعدة بيانات WTI-82K التي تضم 82,335 سؤالاً زمنيًّا عبر 4,812 مسار متناسق، بالإضافة إلى تطوير Stream-GDPO لتحسين عمليات التخصيص للاستجابة الزمنية وتحديث الذاكرة. ومع إنجازاته العالية، يُظهر WTI أداءً متفوقاً بين النماذج الأخرى المفتوحة المصدر، حيث حقق نسبة دقة تصل إلى 83.3% على StreamingBench و73.6% على OVO-Bench.
إذاً، كيف يمكن أن تؤثر هذه التطورات على مستقبل التفاعل مع المحتويات المرئية؟ ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
ثورة جديدة في الذكاء الاصطناعي: نموذج WTI لتفكير وتفاعل ذكي مع مقاطع الفيديو!
نموذج Watch-Think-Interact (WTI) يقدم طريقة مبتكرة لتفسير مقاطع الفيديو من خلال ذكاء الاصطناعي، ويحقق نتائج مذهلة في التحليل متعدد الأسئلة. تعرفوا على كيف يعيد هذا النموذج تشكيل تجربة التفاعل مع المحتوى المرئي!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
