أطلقت مجموعة من الباحثين نموذج Video-DeepResearch (Video-DR)، والذي يمثل نقلة نوعية في مجال الوكلاء الذكيين. هذا النموذج لا يقتصر فقط على معالجة الصور الثابتة، بل يمتد ليشمل تدفقات الفيديو المستمرة، وهو تطور يحتاج إلى فهم معقد لاستمرارية الزمن والمكان.
يتعامل Video-DR مع تحديين رئيسيين تواجههما النماذج الحالية. أولاً، ما يعرف بـ "تحيز الوسائط"، حيث يُفضل الوكيل البحث النصي على أدوات التصور البصري، مما يؤدي إلى فقدان القدرة على تحليل الصور. ثانيًا، لدينا تسرب المعرفة البارامترية، حيث يحصل النموذج على معلوماته من ذاكرته الداخلية بدلاً من التفاعل مع أدوات حقيقية.
لمعالجة هذه المشكلات، تم تصميم Video-DR ليكون لديه مسار إدراك واستكشاف منفصل، مما يجبر النموذج على تحقيق ارتباط بصري شامل بين الإطارات قبل استرجاع المعلومات من الويب. تتضمن العملية التدريبية الخاصة بهذا النموذج مرحلتين: الأولى تتمثل في التوجيه المشرف، تليها تحسين السياسة بالاعتماد على مجموعة من السياسات النسبية (Group Relative Policy Optimization - GRPO)، مما يسمح للاستكشاف التلقائي بكسر قيود التعلم التقليدي.
علاوة على ذلك، تم إنشاء معيار جديد باسم Video-DR-Bench، والذي يتضمن 200 حالة VQA معقدة، تعزز التعاون البشري والذكاء الاصطناعي. النتائج التجريبية أظهرت أن نموذج Video-DeepResearch-35B-A3B حقق دقة قدرها 64.0%، مُتجاوزًا نموذج Claude-4.5-Sonnet بمعدل 5.0 نقاط، ومتجاوزًا أيضًا نماذج GPT-5 وGemini 2.5 Pro.
إذا كنت مهتمًا بالتطورات المذهلة في تقنيات الذكاء الاصطناعي، فإن Video-DeepResearch يمثل خطوة جبارة نحو مستقبل أكثر تفاعلاً وذكاءً. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
Video-DeepResearch: النقلة النوعية في وكيل الذكاء الاصطناعي متعدد الأنماط
تقديم Video-DeepResearch (Video-DR) يكسر حدود الوكلاء المتعددين من الصور الثابتة إلى تدفقات الفيديو الديناميكية، مع تحسينات مذهلة في الدقة والتفاعل. يتصدر هذا النموذج الجديد تطور الذكاء الاصطناعي بمعدل دقة غير مسبوق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
