تسارعت وتيرة التطور في نماذج اللغة الكبيرة (Large Language Models - LLM) في السنوات الأخيرة، مما يطرح سؤالًا محوريًا: هل النماذج المتنوعة بالفعل مستقلة تمامًا؟ يمكن أن تؤدي بيانات تدريب مشتركة، وعمليات تقطير، وخطوط توجيه متكاملة إلى ظهور اعتمادات سلوكية خفية، مما يهدد الأنظمة متعددة النماذج مثل نماذج اللغات كقضاة (LLM-as-a-judge) والتحقق المشترك، والتي تفترض ضمنيًا إشارات مستقلة. في الممارسة العملية، تظهر هذه الاعتمادات كأنماط استدلال مترابطة وإخفاقات متزامنة، حيث تعكس توافقات الظاهر أوضاع أخطاء مشتركة بدلاً من التحقق المستقل.
لمعالجة هذا التحدي، قام الباحثون بتطوير إطار إحصائي لتدقيق التشابك السلوكي بين نماذج اللغة السوداء. يتضمن هذا النهج هرم متعدد الدرجات الذي يصف نمط الإخفاق المشترك من خلال مقياسين نظريين: 1) مؤشر التشابك السلوكي المدعوم بالصعوبة (Difficulty-Weighted Behavioral Entanglement Index - BEI)، الذي يعزز من الأخطاء المتزامنة في المهام السهلة، و 2) مقياس زيادة المعلومات التراكمية (Cumulative Information Gain - CIG)، الذي يلتقط التوافق الاتجاهي في الاستجابات الخاطئة.
من خلال تجارب تشمل 18 نموذج LLM من ست عائلات نموذجية، تم تحديد تشابك سلوكي ذو دلالة إحصائية، وهو ما يرتبط بتحيز المندوب الزائد في مجموعة تقييم MMLU-Pro الغير متقاطعة (rho = 0.508 لـ BEI و rho = 0.520 لـ CIG؛ p < 0.01). يمتد هذا الارتباط أيضًا إلى معيار MATH-500 (rho = 0.441 لـ BEI و rho = 0.457 لـ CIG؛ p < 0.05)، مما يوفر أدلة عبر المعايير أن هيكل الاعتماد المحدد يتجاوز البيانات وصيغة الاستجابة المستخدمة لتقديره.
ختامًا، يظهر الباحثون حالة استخدام عملية للتشابك من خلال إعادة وزن التحقق عبر الأمناء المتشابكين، محققين مكاسب بنسبة 3.5 و 2.6 نقطة مئوية في الدقة والموثوقية على التوالي، مقارنةً بالتصويت بالأغلبية.
إطار إحصائي لتدقيق الاعتماد السلوكي والتحيز في نماذج اللغة الكبيرة
تتزايد أهمية نماذج اللغة الكبيرة (LLM) بشكل متسارع، مما يثير تساؤلات حول استقلاليتها. نقدم إطارًا إحصائيًا يكشف عن الاعتماد السلوكي الخفي بين هذه النماذج، مما يعزز دقة التقييم وموثوقيته.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
