في عالم الذكاء الاصطناعي، أصبح استخدام الأدوات مثل البحث عبر الويب من المقومات الأساسية التي تقيم أداء النماذج اللغوية الكبيرة (Large Language Models) مثل GPT-5. لكن كيف يمكننا قياس قدرة هذه النماذج على التفكير الزمني؟!
في هذا الإطار، تم تقديم مفهوم جديد يُدعى "ألغاز الزمن" (Time Puzzles) — وهو مهمة تستند إلى القيود لاستنتاج التواريخ، تهدف إلى تقييم قدرتها على التفكير الزمني المتكرّر باستخدام الأدوات. كل لغز يجمع بين نقاط زمنية فعلية وعلاقات تقويمية متعددة الثقافات، وقد يقبل تاريخاً واحداً أو عدة تواريخ صحيحة.
تم تصميم هذه الألغاز بشكل خوارزمي، مما يتيح تقييمًا مستمرًا ومراقبًا للأداء. ومع اختبار 13 نموذجًا لغويًا، أظهرت النتائج أن النموذج الأفضل، وهو GPT-5، لم يحقق سوى 55.3% في الدقة عندما لا يُستخدم أداة. وعلى الرغم من أن البحث عبر الويب يُحسن الأداء، فإن النماذج تُظهر نتائج أفضل بكثير عندما يتم إعادة صياغة القيود بتواريخ صريحة، مما يلغي الحاجة إلى البحث عن الحقائق.
تظهر هذه النتائج الفجوة الحالية في الاعتماد على استخدام الأدوات الموثوقة للتفكير الزمني المتكرر، مما يثير العديد من التساؤلات حول كيفية تحسين الأداء الموثوق للنماذج اللغوية في هذا المجال. إذن، كيف يمكن للمبتكرين تقليص هذه الفجوة؟ هل نحن مستعدون للتقدم في استخدام أدوات التفكير الزمني المتسقة؟
ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
اختبار أداء النماذج اللغوية: ألغاز الزمن تُحدي القدرة على التفكير الزمني
تسليط الضوء على الحاجة إلى أدوات تقيم التفكير الزمني في النماذج اللغوية، حيث تظهر الألغاز الزمنية اتجاهاً مثيراً للتقييم الفعال. على الرغم من أن النماذج مثل GPT-5 تُظهر دقة محدودة، فإن استخدام الأدوات يعزز الأداء بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
