إن نماذج الرؤية-اللغة (Vision-Language Models) التي تُستخدم في تطوير الوكلاء المعتمدين على الذكاء الاصطناعي (AI Agents) تُحقق تقدمًا جيدًا في تحويل التوقعات إلى نقرات قابلة للتنفيذ على واجهات المستخدم الرسومية (GUI). ومع ذلك، تظل التقديرات المتعلقة بعدم اليقين (Uncertainty Quantification - UQ) مسألة حرجة لضمان خصوصية سلامة العمليات. تقدم دراسة حديثة نموذج Argus، وهو معيار جديد يقيس عدم اليقين لما بعد العملية في تنفيذ واجهات المستخدم الرسومية حيث يشمل تقييم 27 طريقة مفتوحة الوزن عبر 4 وكلاء للذكاء الاصطناعي و4 مجموعات بيانات.
تتراوح الأساليب التي تم تقييمها بين درجات بناءً على logits، وطرق الانتخابات، وخرائط الانتباه، والسلوكيات بناءً على التواصل الشفهي. واحدة من النتائج الرئيسة تشير إلى الاستقرار الانتقائي، حيث تبقى تصنيفات عدم اليقين مستقرة عبر مجموعات البيانات لنموذج ثابت، ولكنها تتدهور عبر فئات النماذج المختلفة.
يظهر أن الأساليب المعتمدة على الحالة المخفية (Hidden-state methods) وأسلوب الكثافة هي الأكثر استقرارًا في المجموعة المفتوحة. ومع ذلك، فإن أساليب معينة مثل CoCoA-1MCA تُحقق نتائج أفضل في حالات معينة. يتضح أيضًا أن نقل الترتيب داخل النموذج قوي، لكن هذا يعدل بشكل كبير في النماذج المغلقة المصدر، مما يعني أن عدم اليقين المغلق يجب إعادة ترتيبه وفقًا للهدف.
في هذا البحث، نتلقى سجلات مفصلة لكل عنصر وتقسيمات الاختبار/التدريب، مما يسهل اختيار قياسات عدم اليقين في وكالات الواجهات الرسومية.
نحن أمام مستقبل مثير للنظر في كيفية تكامل نماذج الذكاء الاصطناعي مع واجهات المستخدم، فما رأيكم في هذه التطورات المهمة؟ شاركونا في التعليقات!
ما هي الكمية المثلى لعدم اليقين في تقييم نماذج الذكاء الاصطناعي؟
توفر دراسة جديدة نموذجًا جديدًا لتحديد عدم اليقين في نماذج الرؤية-اللغة. تطور هذا النموذج، المعروف باسم Argus، يساعد على تحسين موثوقية قرارات الوكلاء المعتمدين على الذكاء الاصطناعي في التفاعل مع واجهات المستخدم الرسومية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
