في عالم اليوم الذي يتزايد فيه استخدام نماذج اللغة الكبيرة (LLMs) كأدوات تقنية، يبرز تحدي جديد في كيفية تقييم قدرتها على إدارة النفايات الصلبة (SWM). بينما تركز المعايير الحالية على المعرفة العامة، يأتي معيار WuYuEval ليرسم ملامح جديدة من خلال تقييم الأداء المهني في سياقات هندسية، بيئية، وسياسية.

يتمتع WuYuEval بتركيبته الفريدة التي تضم وحدتين رئيسيتين: وحدة الأساس تحتوي على 4,590 سؤالًا من نوع الاختيار من متعدد تغطي ستة أنواع من المهام وثماني فئات مهنية، ووحدة الخبراء التي تتضمن 247 سؤالًا مفتوحًا مبنيًا على سيناريوهات تتطلب اتخاذ قرارات معقدة. يُستخدم في التصنيف المبتكر نظام تقييم معتمد على المقارنات الثنائية، مما يضمن جودة التقييم وموثوقية النتائج.

أظهرت نتائج الاختبارات على 33 نموذجًا مختلفًا تنوعًا كبيرًا في الأداء، حيث حقق النموذج الرائد دقة بنسبة 94.64% في وحدة الأساس. ولكن! هذه الدقة كانت مخادعة، إذ انخفضت المعدلات المتوسطة من 84.14% في الأسئلة السهلة إلى 42.50% في الأسئلة الصعبة، مع تركز الأداء الضعيف في مجالات مثل التصميم الحضري والتخطيط التجريبي.

يضع WuYuEval الأساس لتطوير نماذج مؤسسية تعتمد على إدارة النفايات الصلبة من خلال توفير موارد تقييم تعين الباحثين والممارسين على تحسين تفاعل النماذج مع قيود واقعية ومعقدة. إن هذه المعايير الجديدة تعد دعوة للبناء والمشاركة في حوار حول تحسين النماذج لمواجهة تحديات إدارة النفايات بطرق فعالة.

كيف ترون تأثير هذه المعايير الجديدة على أداء نماذج اللغة الكبيرة؟ دعونا نناقش في التعليقات!