في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغات الضخمة (Large Language Models) من التطورات الثورية. ومع ذلك، يتعلق السؤال الأكثر أهمية بكيفية قياس دقة هذه النماذج. في دراسة جديدة نُشرت على arXiv، تم تسليط الضوء على مفهوم "اليقين" (certainty) وكيفية استخدامه كإجراء غير مباشر لقياس الدقة في تدريب هذه النماذج واستنتاجاتها.

بينما يحتل قياس اليقين مكانة محورية، إلا أن الأداء المرتبط بأساليب اليقين يعتمد على مجموعة من العوامل، بما في ذلك المعلومات المتاحة في درجات اليقين وكيفية استخدامها. من خلال تقييمات تجريبية محكومة عبر مجموعة من النماذج والمهام، اكتشف الباحثون أن اليقين يمكن أن يكون أفضل في تحديد الأسئلة التي من المرجح أن تجيب عليها النماذج بشكل صحيح، بالمقارنة مع تمييز الإجابات الصحيحة من تلك غير الصحيحة.

كما وجدت الدراسة أن اليقين يظهر تغيرات منهجية بناءً على نوع الرموز ومواقعها داخل الكلمات، مما يعكس الخصائص المحلية للنص. تم الكشف عن معلومات حول صعوبة السؤال في وقت مبكر من عملية التوليد، بينما تركز المعلومات الأضعف حول صحة الإجابة بالقرب من نهاية العملية.

تقدم هذه النتائج رؤى قيمة تساهم في اتخاذ القرارات بناءً على مجموعة من العوامل تشمل الهدف من التنبؤ، النموذج المستخدم، ومعيار اليقين، بالإضافة إلى تحديد مواقع الرموز في الإجابات. وبفضل هذه النتائج، تم تحسين دقة النماذج بنسبة 0.83%، بينما انخفض تكلفة الرموز المُنتَجة بنسبة هائلة تبلغ 82.4%.

هل تعتقد أن اليقين على مستوى الرموز يمكن أن يُحدث فرقاً كبيراً في تطوير ذكاء اصطناعي أكثر كفاءة؟ شاركونا آراءكم في التعليقات!