في عالم الذكاء الاصطناعي، لا يزال تحدي تحليل محتوى الوثائق المعقدة يتصدر قائمة الأولويات. حيث تمكنت نماذج اللغات الضخمة متعددة الأنماط (Multimodal Large Language Models - MLLMs) من تحقيق نتائج مبهرة في مهام الفهم الهيكلي، مثل الإجابة عن الأسئلة المتعلقة بالرسوم البيانية والوثائق. ولكن هناك جانب مهم ينقص معظم هذه التقييمات - وهو القدرة على استخدام السياق النصي لاختيار وتفسير وتجميع البيانات من الرسوم البيانية.

هنا يبرز معيار دوكهوب (DocHop) كحل مبتكر، حيث يقدم تقييمًا متكاملًا يجمع بين التفكير في السياق والرسوم البيانية في صور وثائقية. يحتوي دوكهوب على نطاق واسع من الأسئلة يعتمد على تسميات مرجعية موجودة في السرد النصي، مما يتطلب من النماذج حل الكيانات الهدف قبل تجميع الأدلة عبر عدة رسوم بيانية.

تم تصميم دوكهوب باستخدام عملية جيل تعتمد على المنطق العشوائي بهدف تقييم فعالية النماذج. يبدو أن النتائج الأولية تشير إلى وجود فجوة كبيرة بين الأداء البشري ومتوسط أداء النماذج، حيث حقق المراجعون البشر دقة تزيد عن 90%، بينما وصلت أفضل النماذج إلى 62.83% فقط. على الرغم من أن النماذج المعززة منطقياً أظهرت تحسينات، إلا أن الأداء تراجع مع زيادة تعقيد التفكير.

بشكل عام، يمثل دوكهوب منصة تجريبية مُنظمة لتحديات فهم مستندات متعددة الخطوات، ويفتح المجال أمام تطوير نماذج أكثر تقدمًا في عالم الذكاء الاصطناعي.