تقدم دراسات الذكاء الاصطناعي تحديات جديدة تتعلق بفهم الوثائق التي تتطور عبر الزمن، مثل القوانين واللوائح الضريبية. في هذا السياق، لا تُعتبر الإجابات على الأسئلة ثابتة، بل تختلف باختلاف الزمن، مما يجعل ضبط النسخ الزمنية للوثائق أمراً بالغ الأهمية. لذا، تم تطوير معيار يُعرف باسم TIDE لتقديم تقييم شامل لهذه النماذج.
يشمل TIDE 3,050 زوجاً من أسئلة وأجوبة حول 644 مستندًا حكوميًا رسميًا صادرًا من حكومة بنغلاديش، تغطي مجموعة متنوعة من الوثائق بين عامي 1969 و2025. يمثل هذا المعايير المختلفة لمهام الزمن ويتضمن وثائق متنوعة الشكل والتاريخ.
تم تقييم تسعة نماذج لغة ضخمة (Large Language Models) وفق بروتوكول موحد، مع تسجيل النقاط بناءً على دقة الإجابات. وقد أظهرت النتائج أن أفضل دقة وسطية للنماذج بلغت 68.5%. ولكن، كانت النماذج أقل نجاحًا في تحديد النسخة الصحيحة من نصوص قانونية معقدة، مع صعوبة كبيرة في التعامل مع التنوع الزمني في المعلومات.
يدعو هذا البحث إلى إعادة النظر في كيفية تقييم نماذج اللغة في سياقات تتطلب فهمًا عميقًا للأبعاد الزمنية، مما يفتح آفاقًا جديدة للأبحاث في هذا المجال. يمكن الاطلاع على كل الكود والبيانات الخاصة بالدراسة عبر الرابط: [https://github.com/icsetepa44/TIDE]
تحديات الزمن: مقارنة نماذج اللغة الضخمة في فهم الوثائق المتطورة
تعرف على TIDE، معيار جديد يقيّم الأداء الزمني لنماذج اللغة في فهم الوثائق المتطورة. تشير النتائج إلى تحديات كبيرة في دقة النماذج عند التعامل مع النصوص القانونية المتغيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
