في عصر التكنولوجيا المتطورة، تُعتبر نماذج الرؤية-اللغة-الفعل (Vision-Language-Action Models) محورًا أساسيًا في ربط الإدراك البصري بفهم اللغة والتحكم الروبوتي. ومع ذلك، لا تزال هذه النماذج تواجه تحديات كبيرة في المهام الطويلة، حيث يصعب الحفاظ على التناسق الزمني وتراكم الأخطاء وعدم القدرة على التعلم من التجارب الماضية.
لذلك، تم تقديم هيكل خاص يستخدم الذاكرة اللغوية الصريحة لمعالجة هذه القضايا. الفكر المركزي وراء هذا الابتكار هو تحويل الملاحظات الزمنية المتقطعة إلى سلسلة نصية متماسكة تعكس المنطق الزمني، مما يسمح بتحسين تتبع الزمن والتنبيه الديناميكي أثناء تنفيذ المهام الطويلة.
يتكون النظام من نموذج الرؤية-اللغة العالية المستوى (High-Level VLM) ونموذج الفعل-اللغة المنخفضة المستوى (Low-Level VLA). يقوم النموذج العالي المستوى بتمكين التفكير الساماني من خلال تدريب على إجابة الأسئلة المرئية، بينما يقوم النموذج المنخفض المستوى بتنفيذ السيطرة المستمرة بدقة استناداً إلى التعليمات والملاحظات المرئية.
تم اختبار الطريقة المقترحة في عدة بيئات محاكاة وأجريت تجارب من المحاكاة إلى الواقع (Sim-to-Real) على منصة روبوتية حقيقية، وأظهرت النتائج أن الاعتماد على الذاكرة اللغوية الصريحة يزيد من معدل النجاح وقوة النماذج في المهام المعقدة، مقدمًا تفسيرات واضحة لعملية اتخاذ القرار، مما يعتبر تقدمًا مهمًا في مجال الذكاء الاصطناعي.
تحويل الذكاء الاصطناعي إلى قادة في المهام الطويلة: الذاكرة اللغوية الصريحة تكشف عن آفاق جديدة
تباين نماذج الرؤية-اللغة-الفعل في قدرتها على التعامل مع المهام الطويلة، ولكن بفضل هيكلية جديدة تعتمد على الذاكرة اللغوية الصريحة، يمكن تحسين الأداء بشكل واضح. هذه الابتكارات تعزز فعالية الروبوتات في تنفيذ مهام معقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
