تُعتبر البيانات عالية الجودة للتدريب المسبق (pre-training) هي العنصر المحوري لانطلاقة نماذج اللغة التعليمية والنماذج المتخصصة في مجالات العلوم والتقنية والهندسة والرياضيات (STEM)، خاصةً عند العمل على الذكاء الاصطناعي الطرفي (edge AI) حيث القيود الاقتصادية على التوكن (token) تزداد شدة. ورغم أن العديد من المنظمات الكبرى تقوم بتدريب نماذج أكبر على مجموعات بيانات خاصة، إلا أن النظام مفتوح المصدر يعاني من نقص واضح في مجالات STEM، حيث لا تتوفر مجموعات بيانات صناعية قوية تؤدي قيمة تعلم عالية لكل توكن، وهذا ما يجعل الابتكار الجديد QVAC Genesis III محوريًا.

تقدم QVAC Genesis III باقة مذهلة من 191.43 مليار توكن، تغطي 19 مجالًا مختلفًا وتتنوع بين مستويات صعوبة وأنماط تعليمية. تم بناء هذه المجموعة عبر استراتيجية توليد مزدوجة تعتمد على تقنيات تخفيف الأداء باستخدام نموذج طالب ضعيف كإشارة، حيث يتم تحويل إخفاقات الطالب إلى تفسيرات تصحيحية، بينما يتم توسيع نجاحاته إلى استدلالات مقارنة تشمل جميع خيارات الإجابة.

علاوةً على ذلك، نقدم بروتوكول تقييم نماذج اللغات الكبيرة (LLM) كأداة للمعالجة، بحيث يمكن استخراج الإجابات النهائية من المخرجات الحرّة وتتبع دقة الإجابات وصحتها.

لتحقيق أقصى قدر من الفعالية، قمنا بإجراء تجارب تحت السيطرة بنماذج تحتوي على 1.7 مليار بارامتر، حيث أظهرت النتائج أن النماذج المدربة باستخدام QVAC Genesis III تتفوق باستمرار على نماذج أخرى تم تدريبها باستخدام مكتبة Cosmopedia-v2 والموديل العام وكوسمو-1B في معايير ARC وGPQA Diamond وMMLU STEM، مما يحقق نسبة تفوق تصل إلى +28.57% في ARC-E و+21.35% في ARC-C، كما سجلت نسبة دقة الإجابة الصحيحة بنسبة تصل إلى 99.45%.

إذًا، هل أنتم مستعدون لاكتشاف آفاق جديدة في عالم الذكاء الاصطناعي وتطبيقاته في التعليم؟