تشهد مجال الذكاء الاصطناعي تقدماً كبيراً مع ظهور تقنيات جديدة تمكن المعايير من الكتابة الذاتية. تتطلب العديد من التطبيقات، مثل توليد التقارير، معايير موثوقة للتقييم، ومع ذلك، يواجه الكثير منها صعوبة في تحديد كيفية scoring (تقييم) الأعمال. السؤال المطروح هو: هل يمكن للمعيار المعقد أن يكتب نفسه؟
هناك صعوبة كبيرة في تحديد ميزات الجودة في الإجابات، لكن من السهل تحديد العيوب. لذلك، يتم تطوير المعيار كحزمة من المعاملات الصغيرة باستخدام Python، التي ترصد المرشحين لتحديد عيب معين، وفي حالة عدم وجود عيب، يتم تجنب التصنيف.
نموذج EvalCEGAR يستخدم طريقة مبتكرة تسمى التنفيذ المعتمد على ضد الأمثلة لإعادة تقييم المعايير. بدلاً من العمل مع موجهات تقليدية، يقوم بإجراء قراءة شاملة لمجموعة من الاحتمالات، مُسجلاً عملية البحث عن تضارب. هذا التضارب يمكن أن يكشف عن أجوبة صحيحة وأخرى خاطئة، وبذلك يُعتبر الطلب على التأليف.
أظهرت الاختبارات التي أُجريت على مجموعات بيانات مرموقة مثل MBPP+ وHumanEval+ أن هذا النموذج قادر على إغلاق الفجوة بشكل ملحوظ بين الأداء الآلي وآلية التصفية المثالية دون الحاجة إلى المزيد من الحملات اليدوية.
التقنية تقدم حلاً مثيرًا للتعامل مع التحديات في تقييم الأجوبة، ويمكن أن تكون خطوة مهمة نحو تحسين الكفاءة والإنتاجية في استخدام الذكاء الاصطناعي. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
هل يمكن للمعيار أن يكتب نفسه؟ تطور مثير في الذكاء الاصطناعي
تطور حديث في عالم الذكاء الاصطناعي يكشف عن كيفية تمكين المعايير الآلية من كتابة نفسها من خلال تطوير متغيرات ذكية. هذه التقنية تعد بجسر الفجوة بين الأداء الآلي والتقييم البشري بطريقة ثورية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
