في خطوات رائدة نحو ذكاء اصطناعي قادر على التعامل مع المواقف الطارئة، تم تقديم ReactHuman كأول معيار تقييم يُركز على الفيزياء لقياس قدرة نماذج اللغات الكبيرة (Large Language Models) على اتخاذ قرارات سريعة وشبيهة بالبشر عند مواجهة مخاطر فيزيائية مفاجئة. فكر في الروبوتات المنزلية التي قد تواجه صحنًا زلقًا أو سكينًا ساقطًا؛ حيث تتطلب هذه المواقف ردود فعل فورية وذكية تضمن سلامة المستخدم.
بدلاً من الاعتماد على الاختبارات الحالية التي تقتصر غالباً على الإجابة على الأسئلة أو التغلب على تحديات طويلة الأمد مثل التنقل وإعادة الترتيب، تقدم ReactHuman اختبارًا جديدًا يقيم قدرة النموذج على النجاح في ظروف ديناميكية. يشمل هذا المعيار 17 نوعًا من الأحداث وأكثر من 1000 مشهد قابل لإعادة الإنتاج بدقة عالية، مستندًا إلى محاكاة بالأجسام الصلبة بمعدل 240 هرتز.
تم تصميم نظام تقييم يتألف من خمسة معايير لقياس كل رد فعل عبر ثلاثة محاور: معقول وآمن ومبني على أساس فيزيائي. يتم تنفيذ كل قرار حتى نتمكن من ملاحظة نتائجه الفورية، وقد أظهرت النتائج أن التطبيقات الحالية في مجال الذكاء الاصطناعي لا تزال تعاني من صعوبات في التعامل مع المحاذير الفيزيائية، حيث فشلت النماذج في التعامل مع حوالي ثلث المخاطر، وهو ما يدعونا للتفكير في الحاجة للمزيد من التطوير والتدريب على هذه الأنظمة.
ReactHuman: انقلاب في تقييم الذكاء الاصطناعي عبر محاكاة التفاعل البشري مع المخاطر الفيزيائية!
تسعى ReactHuman إلى قياس قدرة نماذج اللغة الكبيرة على اتخاذ قرارات سريعة في مواجهة المخاطر الفيزيائية المفاجئة، مما يعكس أهمية الذكاء الاصطناعي في الروبوتات المنزلية. تمثل هذه المبادرة خطوة مهمة نحو تحسين أداء هذه النماذج وتفعيل استخداماتها العملي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
