في عالم الذكاء الاصطناعي، يمثل التعلم العكسي المعزز (Inverse Reinforcement Learning - IRL) إطارًا قويًا للتعلم من التجارب. لكن، ماذا يحدث عندما تكون المهام الحقيقية مليئة بالتنوعات الطبيعية، مثل التقاط الأكواب بأشكال مختلفة؟ يتعذر حينها جمع التجارب التي توضح تمامًا كيفية أداء مهمة جديدة في كل سيناريو ممكن.

في ظل تلك الظروف، غالبًا ما تكون من الأسهل مقارنةً الحصول على مجموعات بيانات من سلوكيات متنوعة ولكن مرتبطة. ومن هنا، تبرز أهمية التعلم العكسي المعزز القليل الأمثلة مع تجارب متعددة المهام (Few-shot IRL with Multi-task Demonstrations - FM-IRL). حيث يجب على الآلة التعلم من تجارب محدودة وأداء مهام جديدة تختلف بكثير عن تلك التجارب.

لدعم هذه العملية، نحتاج إلى استعادة توزيع الخبراء للمهمة الجديدة، وتوجيه الآلة عند انحرافها عن هذا التوزيع. هنا تأتي ابتكاراتنا الجديدة، والتي نقدم من خلالها التعلم المعزز القائم على تقارب التمييز المتعدد المهام (Multitask discriminator Proximity-Guided IRL - MPG).

تقوم هذه التقنية بتعلّم عنصرين أساسيين:
1. مُميز عام يمكنه نقل البنية المشتركة بين المهام المختلفة للتعرف على سلوك الخبراء في المهام الجديدة.
2. دالة قرب تقيس مدى انحراف الحالة عن سلوك الخبراء، وتقدم توجيهًا تصحيحيًا خلال الاستكشاف.

لقد أثبتت فعاليتنا على مجموعة من المهام في التنقل والتلاعب تحت تنوعات كبيرة، محققةً معدل نجاح متوسط يبلغ 81.2%، متفوقةً على أقوى المعايير بمقدار 24.7 نقطة مئوية. هذا الابتكار يحمل الأمل لمستقبل ذكاء اصطناعي أكثر قدرة على التعلم في البيئات المعقدة.

هل تتفقون أن هذه التقنية ستحدث ثورة في تطبيقات الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!