في عالم الذكاء الاصطناعي، تعد نماذج اللغة-الرؤية-الإجراء (Vision-Language-Action Models) من أهم الابتكارات التي تسعى لدمج القدرة على الفهم البصري مع تعليمات لغوية وتوليد أفعال متزامنة. ومع ذلك، لا تزال التحديات قائمة عندما يتعلق الأمر بتمكين هذه النماذج من تقييم موثوقية توليد أفعالها بشكل ذاتي دون الحاجة إلى إشراف خارجي.
تستند التقنيات الحالية عادةً إلى توصيفات من خبراء أو تقديرات للغموض تعتمد فقط على إحصاءات المخرجات، متجاهلة إشارات داخلية حيوية. هنا يأتي الابتكار الجديد:
لقد لاحظنا أن انتروبي الوضع البصري الداخلية تظهر تمييزات موثوقة بين المهام الناجحة والفاشلة عبر مجموعة متنوعة من نماذج اللغة-الرؤية-الإجراء. على الرغم من اختلاف هياكل هذه النماذج في كيفية توليد الأفعال، أظهرنا أنها تشترك في تجريد موحد لنموذج توليد الأفعال يتطور استنادًا إلى التعليمات اللغوية المدخلة، الإدخال من الحالة، والإدراك البصري.
هذا نتج عنه صياغة "سلسلة ماركوف التوليد الشرطي" (Conditional Generative Markov Chain)، مما أدى إلى تطوير إطار عمل يستند إلى انتروبي الانتباه الماركوفي (Markov Attention Entropy). هذه التقنية الجديدة تحول إشارات الانتباه الداخلية إلى درجات موثوقية تتناسب مع العمارة المستخدمة.
كما قدمنا معيار LIBERO-Reflect المكون من 4,000 حلقة تشمل 2,000 حلقة غير تقليدية و2,000 حلقة تحدٍ متقدمة عبر أربعة مجموعات. أظهرت التجارب الواسعة النطاق عبر هياكل VLA المختلفة وسيناريوهات متنوعة أن MAE يتفوق باستمرار على الأسس المتطورة من حيث تقييم الأداء باستخدام مؤشرات مثل AUPR وAUROC.
أكثر من ذلك، تم تطبيق FabriMAE لاختيار الأفعال بدون الحاجة إلى مدقق، مما أثبت أن تقنية MAE المدعومة تحسن من متانة عائلة PI على LIBERO-Plus مع القليل من التكاليف الزمنية. هذا الابتكار يعد خطوة هائلة نحو تحسين استقلالية وقدرة نماذج الذكاء الاصطناعي في تنفيذ الأفعال بشكل أكثر موثوقية.
ابتكار ثوري في الذكاء الاصطناعي: تقييم ذاتي لنماذج اللغة-الرؤية-الإجراء باستخدام انتروبي الانتباه الماركوفي
يقدم الباحثون نموذج FabriMAE الذي يمكن نماذج اللغة-الرؤية-الإجراء (VLA) من تقييم موثوقية توليد أفعالها ذاتيًا. يعتمد هذا النموذج على انتروبي الانتباه الماركوفي لتحقيق أداء متفوق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
