شهدت التكنولوجيا في السنوات الأخيرة تقدمًا ملحوظًا في نماذج الرؤية واللغة (Vision-Language Models - VLMs)، التي أظهرت قدرات رائعة في التعرف الثابت على الصور والمنطق الدلالي العالي المستوى. ومع ذلك، لا تزال paradigms الاستكشاف المجسدة تعتمد بشكل كبير على التعلم من تقنيات المحاكاة المأخوذة من مسارات محددة أنشأها البشر، مما يحد كثيرًا من قدرة الوكلاء على التعميم.
تكمن العقبة الرئيسية في تحقيق الوكلاء المجسدين المستقلين في تعزيز قدرة الاستكشاف المرئي القابل للتعميم: أي القدرة على تشغيل أجهزة جديدة دون الحاجة إلى أدلة أو تدريب محدد، من خلال ربط المعرفة المجردة بعالم فني إلى استخدامات بصرية دقيقة.
للأسف، غالبية المعايير الحالية لا تقيم هذه القدرة بشكل كافٍ، إذ إنها تعتمد عادة على الوثائق الصريحة والمسارات المعلنة، مما يتجاهل العملية الديناميكية للتفاعل والتعديل التي تعد ضرورية للتشغيل الوظيفي للأجهزة.
لملء هذه الفجوة، نقدم VGEBench، وهو معيار شامل مصمم لتقييم قدرات الاستكشاف القائم على الرؤية القابلة للتعميم لنماذج الرؤية واللغة. وعلى عكس مجموعات البيانات الثابتة، قمنا بإنشاء إطار عمل يعتمد على آلة حالة تحكم منطقية، تحاكي حلقات التفاعل المتعددة، مما يجبر الوكلاء على تحقيق الأهداف من خلال الإدراك البصري النشط والتصحيح المعتمد على التغذية الراجعة.
تشير النتائج التجريبية إلى أن النماذج الحالية تواجه تحديات كبيرة في ترجمة المعرفة الدلالية إلى تنفيذ فعلي، بالإضافة إلى صعوبة في الحفاظ على تتبع الحالة على المدى الطويل. هل نحن أمام تحول حقيقي في طريقة تعامل الأجهزة مع بيئتها؟
استكشاف مبتكر للأجهزة المنزلية: ثورة في نماذج الرؤية واللغة
تسعى التطورات الحديثة في نماذج الرؤية واللغة (VLMs) إلى تعزيز قدرة الأجهزة على التعرف وفهم بيئتها دون الحاجة لدروس تدريبية. تم تقديم معيار جديد يُدعى VGEBench لتحقيق ذلك.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
