في عصر الذكاء الاصطناعي المتطور، يقدم التدريب الفيدرالي المسبق (Federated Pre-Training) وسيلة جديدة لتدريب نماذج الأساس على بيانات خاصة أو موزعة دون الحاجة إلى تجميع البيانات في مكان واحد. ومع ذلك، يبقى تقييم هذا النوع من التدريب تحدياً، حيث يمكن أن تؤثر الاختلافات في مشاركة العملاء وتوفر البيانات المحلية على إمكانية إجراء تقييمات مباشرة وقابلة للمقارنة.

تجدر الإشارة إلى أن تعقيد تقييم الجودة يتزايد، إذ إن درجة الصعوبة في اختبار ما قبل التدريب مرتبطة بالتوزيع الذي تم التدريب عليه، بينما تتطلب المؤشرات اللاحقة (Downstream Benchmarks) تكييفًا خاصًا بالمهمة بشكل قد لا يعكس بدقة دقة الاختبار المقررة أثناء التدريب.

في هذا البحث، يتم تحليل بروتوكولات التقييم المختلفة لتحديد أيها يعكس جودة التدريب الفيدرالي المسبق بشكل أكثر موثوقية. من خلال مجموعة من النماذج المدربة مركزياً وفيدراليًا، بما في ذلك نموذج تحويل يحتوي على 16 مليون معلمة، تمت دراسة كيفية تقييم البرتوكولات من حيث الحفاظ على ترتيب مرجعي تم تحديده باستخدام مجموعة اختبار متطابقة.

تمت مقارنة طرق تحسين النماذج السابقة باستخدام مجموعة GLUE، بما في ذلك الطرق المختلفة مثل الاستفادة الكاملة، والرؤوس فقط، والبيانات المخفضة، مع التنبؤ بالرمز التالي (Next-Token Prediction) كنقطة تقييم داخلية. أظهرت النتائج أن تحسين النماذج لا يحافظ دائمًا على ترتيب ما قبل التدريب، بينما التنبؤ المباشر بالرمز التالي يظهر توافقًا قويًا مع دقة اختبار ما قبل التدريب.

تسلط هذه النتائج الضوء على أن الاعتماد فقط على تحسين المهام اللاحقة قد يكون مضللاً عند مقارنة النماذج المدربة بطريقة فيدرالية. مما يستدعي إيلاء مزيد من الاهتمام للإشارات التي تقترب من الهدف الأصلي للتدريب المسبق.