تمثل أدوات الذكاء الاصطناعي تقدمًا هائلًا في عالم البحث المعلوماتي، لكن هل بمقدورها التعامل مع الفترات الطويلة والاعتماد المعقد بين الأدلة؟ هنا يأتي دور مؤشر Mr.LHDR (Multimodal real-world Long-Horizon Deep Research) الذي يهدف إلى تقييم قدرات وكلاء البحث العميق على الأمد الطويل.

تُعد هذه الأداة الجديدة ضرورية، خاصة في ظل وجود مؤشرات تقيم الأداء على مدى قصير، بينما يتطلب البحث الفعلي دمج أطر متعددة من الأدلة. تم تصميم كل سؤال في هذا المؤشر من خلال مخطط (Node-Relation) مخفي، مما يستلزم الوصول إلى ما يعادل 12.1 استنتاجًا متوسطًا مع عمق اعتماد يصل إلى 10.4 قبل التوصل إلى إجابة واضحة وقابلة للتحقق.

تشمل الأدلة المستخدمة في الأسئلة عناصر متعددة الوسائط مثل الصور والخرائط وملفات PDF والشعارات والرسوم البيانية والجداول وإطارات الفيديو. يكشف مؤشر Mr.LHDR عن دقة الإجابات النهائية وأيضًا صحة الاستنتاجات الوسيطة، مما يعكس قيود الأنظمة الحالية في دمج الأدلة المعتمدة. لا تتجاوز أفضل الأنظمة 43.1% من الدقة الإجمالية، مما يدل على أن تقييم الإجابات النهائية قد يعكس تقييمًا مبالغًا فيه لنجاح البحث.

تشير النتائج إلى أن التحدي الحقيقي لا يكمن فقط في استرجاع المعلومات، بل في دمج الأدلة بطريقة مستدامة ومتسقة. وبالتالي، يكشف هذا المؤشر عن أهمية تعزيز الذكاء الاصطناعي لتجاوز حدود المعرفة المعروفة.

إذا كنت مهتمًا بكيفية تطور تقنيات الذكاء الاصطناعي في مجال البحث، ما رأيك في هذه النتائج؟ شاركونا آرائكم في التعليقات.