في عصر الذكاء الاصطناعي المتطور، تكتسب وكالات واجهة المستخدم المحمولة (Mobile GUI Agents) أهمية متزايدة، حيث يمكنها تنفيذ مهام استنادًا إلى تعليمات لغة طبيعية. ومع ذلك، فإن تقييم أدائها يبقى تحديًا كبيرًا، بسبب صعوبة تحقيق توازن بين الواقعية والقابلية للتكرار.

عادةً ما تفتقر المؤشرات الحالية إلى التعقيد الحقيقي للتطبيقات المحمولة، أو تتعرض لتغيرات غير مسيطر عليها بسبب الإعلانات، والتوصيات، واستخدام الحسابات المختلفة. لذلك، تم إطلاق مشروع AppSim-Bench، الذي يوفر تطبيقات محاكاة قابلة للتحكم تحتفظ بمنطق التفاعل ذي الصلة بالمهام، مما يسهل التقييم المحدد.

تم تطوير AppSim-Bench من خلال عملية تساعدها وكالات برمجية، ويحتوي على 557 مهمة عبر 17 تطبيقًا شائعًا باللغتين الصينية والإنجليزية. تخلص بياناته القابلة للتحكم ومراجعة النتائج من مصادر كبيرة من التغيرات البيئية، مما يمكّن من مقارنة نماذج متعددة بطريقة متكررة.

عند تقييم 19 وكيل واجهة مستخدم، من بين نظم عامة ومتخصصة، تبين أن التنفيذ المستقل من قبل الوكلاء لا يزال بعيدًا عن الحل. حيث أكدت النتائج أن أفضل نموذج يتمكن من إكمال 50.27% فقط من المهام، في حين أن 28.55% من المهام لم يتم حلها بواسطة أي وكيل. تُظهر التحليلات زيادة فشل الوكلاء في التدفقات الأطول والمهام التي تتطلب تفكيرًا عدديًا، بجانب سير العمل غير الفعال.

تساهم هذه النتائج في تحسين فهمنا لتحديات التنفيذ التلقائي على الأجهزة المحمولة، مما يجعل مشروع AppSim-Bench خطوة نوعية نحو تحقيق الأداء الأمثل في هذا المجال. لمزيد من التفاصيل، يمكن للمهتمين زيارة المشروع على GitHub: رابط المشروع.

ما رأيكم في هذا التطور؟ هل تعتقدون أنه سيساهم في تحقيق فائدة أكبر لوكلاء واجهة المستخدم في المستقبل؟ شاركونا في التعليقات!