في عالم الذكاء الاصطناعي، تُعتبر وكالات واجهة المستخدم الرسومية (GUI Agents) من أهم التطورات التي تشهدها التكنولوجيا حالياً. ومع تقدم الأبحاث، تم الكشف عن تقنية مبتكرة تُعرف باسم State Transition Pretraining (STP) التي تعد بمثابة محور أساسي في تطوير هذه الوكالات.
تقوم تقنية STP بتدريب نموذج موحد متعدد الأنماط على انتقالات الحالة المرئية، وذلك من خلال تحسين الديناميكيات العكسية (Inverse Dynamics) التي تتنبأ بالأفعال بناءً على تغييرات الحالة، والديناميكيات الأمامية (Forward Dynamics) التي تتنبأ بالحالات التالية بناءً على الحالة الحالية والأفعال المتخذة. يعزز هذا التحسين النموذج ليتمتع بتمثيلات بصرية قائمة على الأفعال ونموذج داخلي للعالم يوضح ديناميكيات واجهة المستخدم.
عند ضبط هذه النماذج المسبقة على مسارات تحتوي على تعليمات مهمات، أثبتت أن نماذج STP تتفوق باستمرار على المعايير التدريبية التقليدية في اختبارات الأداء لكل من السيناريوهات المكتبية والمحمولة، بما في ذلك AGentNetBench وAndroidControl وGUIOdyssey.
تشير الدراسات التجريبية الإضافية إلى أن تحسين الديناميكيات المشتركة يؤدي إلى تحسينات ثابتة بالمقارنة مع تدريبات الأهداف الفردية، كما أن الأداء يزداد بشكل تدريجي مع زيادة حجم بيانات الانتقال.
إن هذه التطورات تفتح آفاق جديدة أمام الباحثين والمطورين، مما يساعد في خلق أجهزة ذكية قادرة على فهم والتفاعل مع العالم بأسلوب متطور ودقيق.
ما رأيكم في هذه التقنية الجديدة والآثار المترتبة عليها في مجال الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
تسريع وكالات واجهة المستخدم: كيف تدشن التقنيات الجديدة مستقبل الذكاء الاصطناعي؟
تم تقديم تقنية جديدة تُعرف باسم State Transition Pretraining (STP) لتوسيع نطاق وكالات واجهة المستخدم الرسومية. نماذج STP أثبتت نفسها بشكل ملحوظ في تحسين الأداء عبر مشاهدات متعددة للحركة والديناميكيات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
