في خطوة جديدة تضاف إلى قائمة ابتكاراتها، أعلنت شركة Anthropic عن إطلاق نظام تقييم جديد لإضافات Claude Code. يتمحور هذا النظام حول تمكين المطورين من قياس فعالية الإضافات (Plugins) بشكل أكثر دقة من خلال مجموعة من التجارب الواقعية.

يعمل الأمر من خلال تنفيذ أمر تقييم الإضافات (plugin eval command) الذي ينفذ الإضافات ضد مجموعة من الأسئلة الواقعية، ويقوم بتقييم النتائج التي حصل عليها Claude، ومقارنتها بالنتائج الناتجة عن نفس التجربة دون تحميل الإضافة.

ما يميز هذا النظام هو قدرته على الإجابة عن ثلاثة أسئلة رئيسية لم يكن بإمكان مطوري الإضافات قياسها مسبقاً: هل يتم تفعيل المهارة الصحيحة؟ هل يؤدي هذا التفعيل إلى النتائج المرجوة؟ وأخيراً، كيف يمكن مقارنة الأداء الفعلي مع الأداء بالقواعد القياسية؟

تسعى هذه الخطوة إلى تعزيز تجربة المطورين وتحسين جودة الإضافات المستخدمة في أنظمة الذكاء الاصطناعي، مما يمكن أن يحدث ثورة في الكفاءة والفعالية لهذه الأنظمة بما يتناسب مع احتياجات المستخدمين.

يبدو أن Anthropic تعزز مكانتها كشركة رائدة في مجال الذكاء الاصطناعي، حيث تتابع تطوير واستحداث أدوات جديدة للتقييم، فلنتأمل كيف ستتطور الأمور خلال الفترة القادمة! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.