تم إطلاق أداة جديدة تعرف باسم Relay-Bench، وهي معيار شامل وغير مشبع يقيم أداء نماذج الذكاء الاصطناعي في تنفيذ مهام متنوعة عبر مجالات متعددة باستخدام نصوص فقط. تتمثل الفكرة الأساسية وراء Relay-Bench في قياس قدرة نماذج اللغات الضخمة (Large Language Models) مثل GPT-5.5 في تجاوز التحديات التي تضم مجموعة من المشكلات من مجالات مختلفة ضمن طلب واحد.
يسجل النموذج الرائد، GPT-5.5 (xHigh)، 43.3% في هذه التقييمات، ليظهر قوته في حل المشكلات. تتكون مجموعة الاختبارات بالكامل من مشكلات تركيبية، أي مجموعات من المشكلات الفرعية الأحادية المجال والمترابطة، مما يتطلب استدلالًا عبر مجالات متعددة.
تم تصميم هذه التقييمات لتكون أكثر تعقيدًا عن طريق دمج تعليمات ووصول إلى أدوات متنوعة مثل تنفيذ الشيفرات (code execution) والبحث في الويب، مما يشجع النماذج على استخدام جميع الإمكانيات المتاحة.
المجالات التي تم تقييمها تشمل التفكير البصري، البرمجة، الرياضيات، استخراج المعلومات (مع التركيز على البحث في الويب)، حل المشكلات، المعرفة العامة، وتحليل البيانات. وجميع هذه المشكلات تتكون من مشكلتين إلى ثلاثة عشرة مشكلة فرعية، ولا تتطلب مدخلات أو مخرجات متعددة الأنماط.
بهذه الأدوات، يمكن أن يمثل Relay-Bench تحولاً كبيرًا في كيفية تقييم وتطوير نماذج الذكاء الاصطناعي، مما يساعد على دفع حدود ما يمكن أن تحققه هذه النماذج في المستقبل.
Relay-Bench: ثورة في تقييم نماذج الذكاء الاصطناعي عبر تحديات متعددة المجالات!
تمت إضافة اداة جديدة تدعى Relay-Bench لتقييم أداء نماذج الذكاء الاصطناعي في مهام من مجالات متنوعة. النموذج الرائد GPT-5.5 يحقق نتائج مذهلة في هذه التقييمات المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
