تتطور نماذج اللغات الضخمة (Large Language Models) بسرعة، ولكن يبقى التحدي الأكبر هو القدرة على تمييز الإجابات الصحيحة من الخاطئة. لطالما كانت مسألة معرفة ما إذا كانت هذه النماذج تعتمد على معتقدات ثابتة أو مجرد نمط سطحي أسهل للتظاهر. وهنا يأتي مفهوم الاتساق بين السياقات (Cross-Contextual Consistency)، الذي يُعتبر خاصية سلوكية غير مستغلة جيدًا لهذه النماذج.

يتطلب البحث الجديد فهمًا عميقًا: يجب أن تظل الإجابة المعتمدة موثوقة حتى عند تغيير السياق، وذلك عن طريق الاحتفاظ بنفس المهمة تحت تأثير سياقات متعددة. ولتفعيل هذا المفهوم، تم إجراء مقارنة بين إنتاجات النماذج تحت مطالب أصلية وأخرى مختلطة.

من خلال الدراسة المطبقة على 26 نموذجًا و6 مقاييس تتعلق بالتفكير المنطقي، والحقائق، وتوليد الأكواد، وجدت النتائج أن الإجابات التي تظهر تغييرات أقل بين السياقات المختلفة غالبًا ما تكون أكثر دقة أو صحة. تقدم هذه الدراسة اتساق العروض كأساس تكميلي للتقييم، مما يساعد على تحديد أي الأجزاء من المقياس تبقى مفيدة حتى عندما تعتبر النتائج الإجمالية مشبعة.

فهل ستكون هذه الطريقة هي الاتجاه الجديد في تقييم موثوقية نماذج الذكاء الاصطناعي؟ هذا ما سنتناول من خلال تعليقاتكم وآرائكم حول مدى أهمية هذه التقنيات في مستقبل الذكاء الاصطناعي وأبحاثه.