تعتبر عملية التخطيط بالذكاء الاصطناعي (AI Planning) مجالًا حيويًا يركز على تحديد سلسلة من الإجراءات لتحقيق أهداف معينة، وذلك استنادًا إلى نماذج عالمية دقيقة، يتم تمثيلها عادةً بلغة تعريف مجال التخطيط (PDDL). تولي الأبحاث الحالية اهتمامًا كبيرًا بكيفية اكتشاف الأخطاء الموجودة في تلك النماذج وإصلاحها.

تمثل هذه المشكلة تحديًا يتطلب تفاعلاً بين المستخدمين وآليات الإصلاح الآلي؛ حيث يمكن للمستخدمين تقديم خطط اختبار إيجابية تعد حلولًا، بالإضافة إلى خطط اختبار سلبية تفشل أثناء التنفيذ. تعتمد الأساليب الآلية على تعديل نموذج PDDL بما يتناسب مع هذه القيود.

في بحث حديث، تم تقييم قدرة نماذج لغوية ضخمة مفتوحة الوزن (Open-weight Large Language Models) على القيام بمهام الإصلاح هذه باستخدام نهج يعتمد فقط على تلك النماذج. أظهرت التجارب أن القاعدة الرمزية قدرتها على تحقيق درجة F1 تصل إلى 0.49، بينما حققت أفضل نماذج LLM نتيجة بلغت 0.87 مع جهد استدلالي عالٍ، مما يُظهر تحسنًا كبيرًا قدره 0.38.

ومع ذلك، أظهرت النتائج أن معدل النجاح في الاختبارات بلغ فقط 0.82، مما ينخفض إلى 0.06 في مجال Thoughtful. حتى في أفضل الإعدادات التي تشمل تتبع الاختبارات، لم يتجاوز المعدل 0.92. مما يعني أن النماذج الحالية المفتوحة الوزن لا يمكنها ضمان الوفاء بالقيود المطلوبة لإصلاح النماذج بشكل موثوق.

تُظهر هذه النتائج كيف أن الابتكار في التقنيات الحالية لا يزال بحاجة إلى تحسينات وتطويرات هامة، لاستكشاف المزيد من الفعالية في حل مشكلات النماذج المعقدة.