في خطوة جديدة تضاف إلى قائمة ابتكاراتها، أعلنت شركة Anthropic عن إطلاق نظام تقييم جديد لإضافات Claude Code. يتمحور هذا النظام حول تمكين المطورين من قياس فعالية الإضافات (Plugins) بشكل أكثر دقة من خلال مجموعة من التجارب الواقعية.
يعمل الأمر من خلال تنفيذ أمر تقييم الإضافات (plugin eval command) الذي ينفذ الإضافات ضد مجموعة من الأسئلة الواقعية، ويقوم بتقييم النتائج التي حصل عليها Claude، ومقارنتها بالنتائج الناتجة عن نفس التجربة دون تحميل الإضافة.
ما يميز هذا النظام هو قدرته على الإجابة عن ثلاثة أسئلة رئيسية لم يكن بإمكان مطوري الإضافات قياسها مسبقاً: هل يتم تفعيل المهارة الصحيحة؟ هل يؤدي هذا التفعيل إلى النتائج المرجوة؟ وأخيراً، كيف يمكن مقارنة الأداء الفعلي مع الأداء بالقواعد القياسية؟
تسعى هذه الخطوة إلى تعزيز تجربة المطورين وتحسين جودة الإضافات المستخدمة في أنظمة الذكاء الاصطناعي، مما يمكن أن يحدث ثورة في الكفاءة والفعالية لهذه الأنظمة بما يتناسب مع احتياجات المستخدمين.
يبدو أن Anthropic تعزز مكانتها كشركة رائدة في مجال الذكاء الاصطناعي، حيث تتابع تطوير واستحداث أدوات جديدة للتقييم، فلنتأمل كيف ستتطور الأمور خلال الفترة القادمة! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
اكتشف الإضافة الثورية لـ Anthropic: تقييمات إضافات Claude Code تتحول إلى مستوى جديد!
أطلقت شركة Anthropic نظام تقييم جديد لبرنامج Claude Code، يتضمن إمكانية قياس مدى فعالية الإضافات الجديدة. التقييم الجديد يستهدف تحسين أداء المحاكاة الذكية في بيئات واقعية.
المصدر الأصلي:مارك تيك بوست
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
