في عالم التكنولوجيا الحديثة، حيث تتسارع وتيرة الابتكار، تمثل وكالات واجهات المستخدم (GUI Agents) حجر الزاوية في تجربة تفاعل المستخدم. لكن كيف يمكن لهذه الوكلاء أن تتطور ذاتيًا لتحقيق أداء أفضل؟ نقدم لكم GUI-HARVEST، الحل الذي يعد بإحداث ثورة في الطريقة التي نعتبر بها وكالات واجهات المستخدم عبر تحسين قابلية الاستخدام بشكل مستمر!

يعمل GUI-HARVEST من خلال تحسين الحوامل الملازمة لوكلاء واجهات المستخدم، مما يؤثر على كيفية تجميع الملاحظات، تنفيذ الإجراءات، والتحقق من النتائج. يكمن التحدي في كيفية التوفيق بين نوايا النموذج والملاحظات المرئية، تشخيص الأخطاء تحت نتائج التنفيذ المتغيرة، وتحديد أنماط الفشل المتكررة عبر المهام وتحويلها إلى تغييرات قابلة لإعادة الاستخدام.

أولاً، يقوم GUI-HARVEST بتنسيق مخرجات النموذج والإجراءات المنفذة من خلال مقارنات بين لقطات الشاشة قبل وبعد التنفيذ، مما يربط النتائج بالتغييرات المحددة في واجهة الاستخدام. ثانيًا، وبفضل تحليل التكرار، يُعتبر تنفيذ المهام المتكررة كوحدة دليل مشتركة، مما يساعد في تحديد الفروقات السلوكية ذات الصلة بالنتائج.

أظهر التجريب على مجموعة بيانات OSWorld-Verified أن GUI-HARVEST قد حقق مكاسب ثابتة على النماذج التقليدية، حيث حصل نموذج Qwen3-VL-32B-Instruct على زيادة قدرها 12.33 نقطة في الأداء. علاوة على ذلك، أظهر التحويل باستخدام الحوامل المُجمدة تحسينًا بنسبة 13.87 نقطة في نموذج GPT-5 دون الحاجة إلى تحسين إضافي، مما يسلط الضوء على كفاءة هذا النظام.

مع GUI-HARVEST، يمكن لوكلاء واجهات المستخدم الآن تحقيق نتائج غير مسبوقة وتحسين الأداء بفضل القدرة على التعلم الذاتي والتكيف مع التحديات الجديدة. ما رأيكم في هذا التطور؟ شاركونا آراءكم وأفكاركم في التعليقات!