أصبح وكلاء الواجهة الرسومية (GUI Agents) القائمون على نماذج لغوية ضخمة (Large Language Models) جزءًا أساسيًا من استخدام تقنيات الذكاء الاصطناعي في عدة بيئات، من الهواتف المحمولة إلى المواقع الإلكترونية وسطح المكتب. لكن، كانت الوكلاء الحالية غالبًا ما تكون محدودة بخصوص مجالات معينة، مما يؤثر على تجربة المستخدم. هنا يأتي دور تقنيات مثل MAGA، التي تهدف إلى دمج نماذج متخصصة في سياسة واحدة عبر جميع البيئات.

تعتمد تقنية MAGA على مبدأ دمج الأوزان (Weight Merging)، حيث يتيح دمج الخبراء المتخصصين، لكنه قد يتسبب في فساد الإجراءات القابلة للتنفيذ. لهذا، جاءت تقنية التحليل على السياسات (On-policy Distillation - OPD) التي تساعد في تجنب الإشراف المتضارب، ولكن ما زالت هذه الطريقة تعالج جميع الرموز الاستجابة بشكل متساوٍ، متجاهلةً أن الرموز الإجرائية هي الوسيلة الوحيدة للتفاعل بين البيئة والوكيل.

تقوم تقنية MAGA بإعادة تخصيص إشارة التدريب بناءً على الهيكلة الخاصة للإجراءات. حيث تقوم بتقليل إشارات التحليل غير الضرورية أو غير الصالحة، مما يركز التعلم على الإجراءات الخاطئة. كما تقدم إشارة تدريبية فقط لتحسين إشارة الإشراف المقدمة من المعلمين المتخصصين دون تغيير المدخلات الخاصة بالطالب.

تجارب MAGA على نموذجين مختلفين الحجم أثبتت تحقيق أعلى معدل نجاح، متفوقةً على أقوى الأسس بإضافة 2.0%، مع الحفاظ على أداء متسق مع المعلمين.

باختصار، تفتح تقنية MAGA الآفاق لتجارب مستخدم أكثر تميزًا وسلاسة في استخدام وكالات الواجهة الرسومية عبر منصات متعددة، مما يجعلها علامة فارقة في مجال الذكاء الاصطناعي.