في عالم الذكاء الاصطناعي، تُعتبر السياسات المنظمة (Structured Policies) من العوامل الأساسية لتحقيق كفاءة وموثوقية ووضوح في التعلم من خلال التقليد (Imitation Learning). ومع ذلك، فإن الأساليب الحالية لإنشاء هذه الهياكل تعتمد عادةً على مدخلات بشرية موسعة أو على معرفة ثابتة مُشمّرة في نماذج اللغات الضخمة (Large Language Models)، مما يؤدي إلى عدم التوافق في بعض الأحيان مع العروض التوضيحية التي يقدمها الخبراء.

في دراسة جديدة، تم اقتراح إطار عمل مغلق يحسن من السياسات المنظمة من خلال تحليل المعلومات الناتجة عن تلك السياسات باستخدام نماذج اللغات الضخمة. حيث يقوم هذا النهج بتسجيل عمليات التنفيذ كبيانات جدولة ذات دلالة، بالإضافة إلى تحفيز نماذج اللغات الضخمة لإنشاء شفرات تحليل تشخيصية. وهذا يساعد في تحديد نقاط الضعف في هيكل السياسة وتصحيحها بشكل تكراري دون الحاجة إلى تعليمات بشرية.

لقد أظهرت التجارب في مهام مثل سباق السيارات وفتح الأبواب أن هذه الطريقة تعزز الأداء في التعلم من خلال التقليد حتى 15% مقارنة بالهياكل الناتجة عن نماذج اللغات الضخمة بدون أي اختبار مسبق، وتحتاج إلى 75% أقل من الحسابات لتحقيق نفس أداء التعزيز التعلمي. تبرز هذه النتائج أهمية تحليل بيانات الجدول كأداة فعالة لتوفير إشارات تغذية راجعة تهدف إلى محاذاة هياكل السياسات الناتجة عن نماذج اللغات الضخمة مع العروض التوضيحية من قبل الخبراء، مما يتيح لنا توليد هياكل سياسية جيدة بشكل تلقائي.

أخيراً، يبدو أن هذه التقنية الجديدة تمثل خطوة ثورية قد تعيد تشكيل طريقة فهمنا وتطبيقنا للذكاء الاصطناعي.

ما رأيكم في هذا التحول المثير في مجال الذكاء الاصطناعي؟ شاركونا في التعليقات.