في عصر الذكاء الاصطناعي، معظمنا يركز على أداء نماذج اللغات الضخمة (Large Language Models) ولكن هل تساءلت يومًا عن كيف يمكن أن تؤثر البيئة المستخدمة في اختبار هذه النماذج على النتائج؟ بحث جديد يستعرض تأثير أطر الاستنتاج مثل HuggingFace وvLLM وOllama، ويظهر كيف أن اختيار بنية معينة يمكن أن يغير اختلافات الأداء.

عبر دراسة شاملة شملت ثلاثة نماذج مضبوطة على أساس التعليمات إضافة إلى خمسة أطر استنتاج و ستة معايير للتقييم، تبين أن تغيير البيئة يمكن أن يؤدي إلى تغييرات ملحوظة في أداء النماذج. بشكل خاص، كان الأداء مختلفًا وفقًا للوضع المرتبط بالتحصيل، حيث وجد أن حوالي 39% من تباين الأداء كان مرتبطًا بالخلفية المستخدمة، بينما كانت بقية الاختلافات تنبع من اضطرابات العينة وإعدادات التحكم المستخدمة في أطر العمل المختلفة.

تظهر النتائج أن الانحرافات في أداء النماذج كانت أكثر وضوحًا عند قياس الأداء بناءً على معايير الحقائق مقارنة بمعايير التحيز الاجتماعي، ما يعكس أهمية الشفافية في كيفية تصنيف أداء هذه النماذج. ينصح الباحثون بضرورة الكشف عن الخلفيات المستخدمة كلما تم نشر نتائج جديدة، مما يساعد على توفير سياق واضح ويسمح بمقارنات عادلة بين النماذج.