في عالم الذكاء الاصطناعي، يحمل استخدام نماذج التفكير (Reasoning Models) وعدًا كبيرًا في مساعدة الباحثين على فهم البيانات المعقدة. ولكن، ماذا يحدث عندما تواجه هذه النماذج تحديات تتعلق بالتحقق من الهوية؟ وفقًا لدراسة جديدة تم نشرها على arXiv، تُظهر النماذج تباينًا كبيرًا في دقتها وموثوقيتها في التعامل مع التأثيرات السببية.

تشير الدراسة إلى أن نماذج التفكير يمكن أن تفشل في استرداد تأثير سببي بناءً على البيانات الرصدية، وتنطوي هذه الفشل على نوعين: إما رفض استعلامات قابلة للتحديد أو تقديم إجابات على استعلامات غير قابلة للتحديد، والأخيرة تعتبر أكثر خطورة. فبدون بيانات رصدية، لا يمكن اعتماد الصيغ المزعومة.

للتغلب على هذه التحديات، تم تطوير نظام CERTID، وهو خط أنابيب للتحقق من الهوية، يستخدم خوارزمية تحديد سببي موثوقة وقابلة للاكتفاء للتحقق من قابلية تحديد التأثيرات من الرسوم البيانية (Graphs) والاستعلامات ذات الصلة. وعلاوة على ذلك، يقوم CERTID بمراجعة الصيغ المسترجعة وفقًا لنماذج سببية هيكلية مما يضمن دقة نتائجها.

المثير للاهتمام أن نتائج تقييم ثلاث نماذج متقدمة (Gemini Flash، Gemini Pro، وGPT 5.5) كشفت عن تباين كبير حيث أن معدل الادعاءات الزائفة على الاستعلامات غير القابلة للتحديد كان متفاوتًا بما يصل إلى سبعة عشر مرة بين النماذج. كما تبين أن النماذج كانت ذات دقة تتراوح بين 97 إلى 100% في تحديد إمكانية تحديد التأثيرات لبعض الرسوم البيانية بعد إنهاء عملية التدريب.

استكشفوا المزيد حول هذا المصدر الجديد، وشاهدوا كيف يسعى CERTID إلى إصلاح الفجوات الحرجة في البيانات الرصدية وتعزيز موثوقية النماذج في هذا الحقل.