في خطوة رائدة في عالم الذكاء الاصطناعي، قدم الباحثون معيارًا جديدًا يُعرف باسم TempCloze، وهو معيار لتقييم قدرة نماذج الذكاء الاصطناعي على استنتاج الأحداث الزمنية الناقصة في مقاطع الفيديو. يتمثل التحدي الأساسي في أن الكثير من اختبارات الاستنتاج الزمني كانت تعتمد على اللغة، مما يفتح مجالًا للتلاعب اللغوي.
يعتمد معيار TempCloze على تقديم مقطع بداية ونهاية لفيديو، حيث يجب على النماذج الذكية تحديد الجزء المفقود من أربعة خيارات. يتضمن هذا المعيار 1521 فيديو تم اختيارها بدقة من سبع مصادر مختلفة، تركز بشكل أساسي على الفيديوهات الطويلة والفيديوهات الذاتية.
تركز عملية التقييم على ثلاثة أبعاد رئيسية: التساؤلات الدلالية التي تسأل عن الحدث الذي ينبغي أن يحدث، المحاذاة الزمنية التي تختبر متى يجب أن يحدث، والتقدم الذي يختبر كيف يجب أن يتطور الحدث. كما يساعد تقليل وجود مشاهد وأشياء مشتركة في تقليل الإشارات البصرية المضللة.
عند تقييم 10 نماذج فيديو لذكاء الاصطناعي مغلقة المصدر و21 نموذجًا مفتوح المصدر، اتضح أن المحاذاة الزمنية هي عنق الزجاجة الرئيسي: فقد تعرفت النماذج غالبًا على المحتوى الدلالي المعقول وتقدم الأحداث المحلية، لكنها واجهت صعوبة في محاذاة الأحداث الزمنية. أظهر الباحثون أيضًا أن الأنماط الخطأ والتحليلات السلوكية على نماذج مختارة مثل TempCloze-Mixed وTempCloze-Hard تكشف عن أماكن الأخطاء وتأثير ترتيب الخيارات وسياق الاتجاه والكثافة الزمنية.
من خلال هذا الابتكار، يسعى الباحثون إلى تحسين قدرة نماذج الذكاء الاصطناعي على فهم السياقات الزمنية في الفيديوهات، مما يمهد الطريق لتحسين الأداء في تطبيقات متعددة مثل التحكم في الروبوتات والرؤية الحاسوبية.
TempCloze: ثورة في تقييم الذكاء الاصطناعي لفهم الزمن في الفيديوهات!
أطلق الباحثون معيارًا جديدًا يُدعى TempCloze، يهدف إلى تحسين تقويم قدرة نماذج الذكاء الاصطناعي على استنتاج الأحداث الزمنية الناقصة في مقاطع الفيديو. يتضمن هذا التقييم 1521 فيديو مختار بعناية من مصادر متنوعة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
