تتطور تقنيات الذكاء الاصطناعي بوتيرة سريعة، ومن بين أبرز هذه التقنيات نماذج اللغة الكبيرة (Large Language Models، LLMs). في الآونة الأخيرة، تناولت دراسة مثيرة نشرها باحثون على موقع arXiv موضوع العمومية وكيفية تقييمها بشكل مختلف.

تعتبر العمومية في نماذج اللغة الكبيرة القدرة على إنتاج مخرجات متسقة ودقيقة دلالياً عندما يتم تقديم نفس المدخل بطرق مختلفة. لكن، هل يتم قياس دقة هذه العمومية بشكل صحيح؟ عادة ما يتم تقييم العمومية من خلال دقة إجمالية مبنية على نموذج واحد، مما يؤدي إلى خلط الاستقرار بالفاعلية العامة.

تقدم الدراسة الجديدة رؤية مبتكرة لتقييم الاستقرار من خلال نظام تقييم خاص يعرف باسم "هدف العمومية المعتمد على الاستقرار" (Stability-Aware Generalization Objective أو SAGO). هذا النظام يقيس مدى تغير سلوك النموذج لنفس المدخل تحت تشكيلات وتفاعلات مختلفة، بما في ذلك استمرارية التوليد، والتنشيطات الداخلية، وثقة النموذج، وكذلك محاكاة الاستجابات.

ومن النتائج المثيرة التي توصلت إليها الدراسة، أن العديد من النماذج المستخدمة حالياً تظهر عدم استقرار عام كبير. بمعنى آخر، لا توجد نماذج تعمم بشكل موحد، حيث أن المحاور السلوكية تكشف أنماط فشل مستقلة، مما يشير إلى أن تنويع البيانات عبر مختلف المجموعات يمكن أن يعكس تصنيفات النماذج.

مع هذا التطور، يمكننا أن نتساءل: هل حان الوقت لإعادة تقييم معايير تقييم نماذج الذكاء الاصطناعي بشكل جذري؟ كيف يمكن أن يؤثر هذا على تطبيقات الذكاء الاصطناعي؟

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.