في عالم الذكاء الاصطناعي، يتغير كل شيء بسرعة ليتماشى مع احتياجات جديدة وممارسات متطورة. كان تقييم الوكلاء المتنقلين يعتمد سابقًا على أنظمة قائمة على القواعد، لكنه انتقل مؤخرًا إلى نهج مستند إلى النماذج لتحقيق تقييمات آلية وقابلة للتوسع. ومع ذلك، كانت الطرق الحالية في التقييم تعالج المسارات بشكل كامل دفعة واحدة، مما أدى إلى overload هائل في السياق.

تقديم CRATE، إطار عمل مبتكر يعتمد على آلية استدلال خطوة بخطوة، يتيح تقييم الوكلاء المتنقلين بطريقة أكثر دقة وفاعلية. يعمل CRATE بشكل متوافق مع كلا النموذجين، المفتوح والمغلق، مما ينفتح على آفاق جديدة من التقييم. الميزة الأبرز فيه هي استحداثه لآلية استدلال نتائج خطوة بخطوة، حيث يقوم باستخراج أدلة بصرية ذات صلة بالمهام واستنتاج التغيرات في الحالة الناتجة عن الأفعال في كل خطوة.

تتوج هذه الأدلة النصية من خلال تجميع المسار لتقديم تقييم مستند إلى الأدلة حول إتمام المهام. بالإضافة إلى ذلك، تم تطوير CRATE ليشمل CRATE-S، الذي يركز على تقييم السلامة التشغيلية، مما يعزز قدرتنا على فهم المخاطر المرتبطة بالعمليات.

التجارب الواسعة التي أجريت أثبتت فعالية كل من CRATE وCRATE-S، خاصة مع النموذج Qwen2.5-VL-72B-Instruct، حيث حقق CRATE سجل F1 0.833 على AndroidWorld، متفوقاً بذلك على SPA-Bench بنسبة 20%. كما وصل CRATE-S إلى سجل F1 0.697 على MobileRisk، مما يظهر توافقًا قويًا مع الحقائق المعيارية.

هل أنتم مستعدون لاستكشاف هذه الإبداعات الجديدة في عالم الذكاء الاصطناعي؟ شاركونا أفكاركم وتعليقاتكم!