في عالم الذكاء الاصطناعي، يُعد الاعتماد على التقييم الآلي لوكلاء اللغة الكبيرة (Large Language Models) موضوعًا مثيرًا للجدل. رغم أن النتائج تعتمد في كثير من الأحيان على أسس موثوقة، إلا أنه نادرًا ما يتم التحقق منها بشكل فعلي مقارنة بالتحكيم البشري. ولتسليط الضوء على هذه النقطة، تم تقديم أداة جديدة تُدعى **AgentProp-Bench**، والتي تعد مقياسًا تشخيصيًا يضم حوالي 14,750 أثرًا تنفيذيًا من 13 وكيلًا لغويًا (9 تجارية و4 مفتوحة المصدر) عبر أربعة مجالات.

تسلط الأداة الضوء على ثلاث نقاط رئيسية. أولاً، تظهر نتائج التحكيم من خلال طريقة تقدير النصوص أن توافقها مع التقييمات البشرية يتجاوز مستوى الصدفة فقط، حيث بلغ معامل كوهين (Cohen's kappa) 0.049 عند مقارنته مع مستخدمين بشريين. بينما يصل توافق مجموعة من ثلاثة وكلاء لغويين (LLMs) إلى قيمة معتدلة تفوق 0.432، يعتبر وكيل **GPT-4o-mini** الأكثر دقة بمعدل 0.567.

ثانياً، تظهر التجارب أن الأخطاء التي يتم تحديدها على مستوى المعلمات يمكن أن تؤدي إلى إجابات خاطئة بمعدل احصائي قدره 0.62. هذا النمط تم تأكيده عبر نماذج تجارية ومفتوحة المصدر، مما يعكس أهمية تعامل الوكلاء مع المدخلات غير الصحيحة.

أخيرًا، توضح النتائج أن بعض الوكلاء يقومون بإنشاء أوامر تنفيذية خاطئة بشكل مصطنع، مما يسلط الضوء على ضعف الموثوقية في الأنظمة الآلية فقط. وقد أثبتت أداة تعديل الأداء القابلة للتعديل أنها تساهم إلى حد كبير في تقليل هذه الهلوسات.

إن تقديم هذه الأداة الجديدة كتشخيص لموثوقية وكالات الذكاء الاصطناعي يمثل خطوة حاسمة نحو تحسين معايير الأداء. قد يكون هذا تطورًا مثيرًا يدفعنا جميعًا نحو مزيد من الاعتماد على التقييم البشري لضمان دقة وموثوقية التكنولوجيا.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!