تعبر نماذج اللغة الكبيرة (LLMs) عن صيغة جديدة في تقييم المعالجة اللغوية الطبيعية (NLP)، لكن تبقى موثوقيتها موضع تساؤل. رغم اعتبارها معيارًا للحقيقة المحددة، إلا أن دراسة جديدة تسلط الضوء على جوانب ضعف خطيرة.
أجرت مجموعة من الباحثين تحليلًا شاملًا موثوقًا، حيث اختبروا ستة نماذج متقدمة عبر أربعة مقاييس، خمسة أشكال من المطالبات، ترتيبين تقديميين، ثلاث درجات من حرارة العينات، وعشر تكرارات لكل شرط. وكشفت النتائج عن تقلبات كبيرة في الأحكام؛ حيث تتغير الأحكام حتى عند إعادة التجارب بالظروف نفسها.
على سبيل المثال، أظهرت النتائج أن تغييرات ترتيب العرض تؤدي إلى تغيير حكم الأغلبية في المهام الصعبة، بينما تمكن نموذج القاضي الأكثر موثوقية من تحقيق تناسق مثالي عبر تكرار أحكام غير صحيحة، متفقًا مع الحقيقة فقط بنسبة 51%.
لإضفاء المزيد من الدقة على هذه الأنماط المتعددة للفشل، تم تقديم معدل الحكم الجدير بالثقة (T)، وهو مقياس موحد يقيس احتمال إعادة إنتاج التقييم ودقته. وباستخدام هذا المقياس، تم اشتقاق حدود عليا نظرية للدقة تتأثر بتحيز الموقع، ويظهر أن موثوقية التقييم ترتبط بالعناصر الفردية بدلاً من النموذج ككل.
وأخيرًا، أظهرت الدراسة أن الانتقال من تقييمات الفائز في المقارنة الثنائية إلى التقييم الشامل للقواعد يعزز الثقة بشكل أكبر من أي تدخل مؤثر في البلاك المصنف، مما يقدم إطار عمل قابلاً للتنفيذ لتحسين موثوقية تقييمات المعالجة اللغوية الطبيعية.
إعادة التفكير في موثوقية نماذج اللغة الكبيرة: هل كل الأحكام متساوية؟
تتأكد دراسة جديدة من أن نماذج اللغة الكبيرة (LLMs) لا تقدم أحكاماً موثوقة انتقائياً، حيث تكشف عن عيوب كبيرة في دقة تقييمها. كما تقدم تحليلًا شاملاً لزيادة الثقة في هذه النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
