تشير الأبحاث الجديدة إلى تطور مثير في كيفية معالجة الوثائق المحتوية على نصوص وجداول دعماً للإجابات على الأسئلة. يتطلب العمل مع البيانات الواقعية معالجة طويلة للمدخلات، وخاصة عند دمج النصوص مع الجداول، مما يشكل تحدياً كبيراً لتحسين الفعالية وكفاءة النموذج.

حيث يقدم ضغط السياق البصري (Optical Context Compression) حلاً محتملاً عن طريق تمثيل السياق كصور، لكنه يظل غير واضح تأثيره على فهم الجداول. في هذا الإطار، تم إجراء دراسة متعمقة حول ضغط الجداول على مستوى البكسل (Pixel-Level Table Compression) وكيف يمكن أن يؤثر على جودة الإجابات من الوثائق التي تحتوي على جداول متعددة.

تقييم الدراسة اعتمد على خمسة نماذج لغة بصرية (Visual Language Models) عبر معايير اختبار متعددة، حيث أظهرت النتائج أن تمثيل الجداول كصور بجودة دقتها الأصلية يعادل النصوص في الأداء والكفاءة، ولكن عند تخفيض دقتها، كانت النماذج مضطرة لتعويض فقدان القابلية للقراءة من خلال أطوال تبرير أطول، مما يلغي التوفير المتوقع.

من جهة أخرى، أظهرت الجداول منخفضة الدقة أنها لا تزال تحتفظ بإشارة كافية لتحديد أهميتها بالنسبة للسؤال المطروح. لتوظيف هذه الميزة، تم استخدام طريقة جديدة لا تتطلب تدريبًا تعتمد على خطوتين: أولاً، يحدد النموذج الجداول اللازمة للإجابة من السياق المضغوط على مستوى البكسل، ثم يقوم بالتحليل عليها بجودة دقتها الأصلية.

هذا الأسلوب الجديد سجل توفيرًا بنسبة 41% من الرموز الإجمالية وحقق زيادة قدرها 7 نقاط في دقة الإجابة مقارنة بأسلوب الإجابة على خطوة واحدة باستخدام جداول بدقة أصلية. بالإضافة إلى ذلك، استخدم 15% رموز أقل من أكثر التكوينات المضغوطة كفاءة، دون أي فقدان في الدقة.

في النهاية، إذا كنت من المهتمين بطرق جديدة لتحسين دقة الإجابات وزيادة كفاءة استخدام الرموز، فما رأيك في هذا التطور المذهل؟ شاركونا في التعليقات!