في إطار ثورة الذكاء الصناعي، يكشف فريق بحثي عن ابتكار مذهل بعنوان NavGPT-3، الذي يقدم نهجًا مبتكرًا في استخدام نماذج لغوية متطورة قادرة على معالجة المعلومات بطريقة سلسة ومؤثرة في بيئة حقيقية. يعتبر NavGPT-3 دمجًا بين التعلم العميق والسياسات السلوكية، مما يمكن وكالات الروبوتات من استيعاب السياقات المختلفة والتفاعل معها بشكل أكثر فعالية.
تظهر الأبحاث أن نماذج اللغات المزودة بالتعلم الأسي يمكنها تعميم المعرفة من خلال التفكير المنطقي، وتعمل على تنفيذ إجراءات دقيقة وتحقيق الأهداف على مدى خطوات متعددة. وهذا يشير إلى ارتفاع مستوى الفهم واتخاذ القرار لدى الوكلاء المجسدين.
يحتوي NavGPT-3 على هيكل عمومى يشبه نظام التشغيل، يتضمن عمليات التفكير، التنفيذ، والمراقبة كخيوط لها سياقات وأدوات وتصاريح مستقلة، مما يتيح للروبوت الاستجابة السريعة للأحداث المفاجئة.
المثير للاهتمام هو أن النموذج NavGPT VLA، المدرب على 19.28 مليون مثال، يحقق نتائج مذهلة تصل إلى 74.51 SR في R2R-CE ويتصدر قائمة RxR-CE مع 78.19 SR. ومن خلال استخدام الهيكل الكامل لـ NavGPT-3، تم تسجيل نتيجة قياسية جديدة هي 81.51 SR في R2R-CE. ليس هذا فقط؛ بل يستطيع النموذج أيضًا منافسة البشر بمستوى نجاح مشابه في التوجه (90.43 مقابل 90.4 SR) وولاء المسار (78.47 مقابل 77.7 nDTW).
علاوة على ذلك، تقليل زمن الاستجابة من 3-19 ثانية لكل قرار لنموذج اللغة إلى 0.5-1 ثانية لكل خطوة في سياسة العمل يعكس أهمية تصميم هذا الواجهة المجسدة في ربط الذكاء الحديث في نماذج اللغة مع التحكم الفيزيائي على مستوى منخفض.
واختتم الباحثون بأن جميع النماذج والشيفرات وسجلات التقييم ستتوفر قريباً للجمهور، مما سيفتح المجال لمزيد من الأبحاث والتطبيقات العملية في عالم الذكاء الاصطناعي.
NavGPT-3: ثورة في التنقل الذكي عبر نماذج لغوية متطورة!
تقدم NavGPT-3 طريقة رائدة لدمج التعلم الأسي للوكالات مع نماذج اللغات لتعزيز القدرات الإدراكية والتحكم في الروبوتات. هذا الابتكار يتيح تفاعلاً فوريًا وفعالًا مع العالم الحقيقي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
