في خطوة جديدة نحو فهم كيفية استجابة نماذج اللغات الضخمة (Large Language Models) للحقائق، أعلن الباحثون عن تطوير مؤشر PROOF، الذي يهدف إلى قياس موثوقية الحقائق بشكل أكثر دقة. يعتمد هذا المؤشر على تحويل لقطة بيانات ويكيداتا المجمدة إلى 18,486 سؤالًا متعدد الخيارات، مستندًا إلى 11,779 حقيقة دلالية.
تحتوي الأسئلة على خيارات متعددة، بما في ذلك خيار "لا أعرف" وخيار "لا يوجد خيار صحيح"، مما يسمح بتقييم دقيق لكيفية استجابة النماذج. تم اختبار 18 نموذجاً مفتوحا على مجموعة ضخمة من 166,374 مثلاً، لتظهر النتائج تفاوتات في الدقة تتراوح بين 6.58% و57.59%، وهو ما يعكس عدم التناسق في الاستجابات حسب المجال المستخدم.
تظهر النتائج أن نماذج اللغات لا تتفق دائمًا في كيفية معالجة الحقائق، حيث تكشف الأبحاث عن أن توجيه الاستفسارات يمكن أن يؤثر على دقتها. كما تشير الدراسات إلى أن التغييرات اللغوية البسيطة يمكن أن تؤثر بشكل كبير على نتائج الإجابات، مما يدعو لفهم أعمق لإمكانيات هذه النماذج.
يعتبر هذا التطور خطوة هامة في تقييم كيفية معالجة نماذج اللغات للحقائق، ويعزز من أهمية استخدام أدوات مثل PROOF لتحسين دقة المعلومات التي تقدمها هذه النماذج. فهل أنتم مستعدون لاستكشاف هذا المجال المتقدم؟ شاركونا آراءكم وتجاربكم في التعليقات.
اكتشاف موثوقية الحقائق في نماذج اللغات الضخمة: PROOF يكشف المستور!
مؤشر PROOF الجديد يقدم طريقة مبتكرة لتقييم موثوقية الحقائق في نماذج اللغات الضخمة. اكتشف كيف تمت معالجة 18,486 سؤالاً متعدد الخيارات لنماذج اللغة في هذا البحث الثوري!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
