في عالم الذكاء الاصطناعي، تُعدُّ القدرات التخطيطية طويلة الأمد من المتطلبات الأساسية لوكلاء النماذج الأساسية. لكن كيفية تعزيز هذه القدرات لا تزال مسألة محورية في الأبحاث. تستند معظم النماذج الحالية إلى بيانات غير واضحة وغير قابلة للتحكم من الإنترنت، مما يحد من قدرتنا على فهم كيفية اكتساب هذه القدرات التخطيطية وتشكيلها.
للمضي قدمًا، تقدم الأبحاث الجديدة بيئة متعددة الجولات (multi-turn) وموحدة تسهم في التحكم الدقيق، مما يسمح بدراسة التخطيط الطويل الأمد عبر ثلاث مراحل رئيسية:
1. **اكتساب القدرة التخطيطية خلال ما قبل التدريب (pre-training)**: تركز الأبحاث على تنسيق البيانات وجودتها، حيث تُظهر نماذج بناء العالم الصريح من خلال نموذج انتقال الحالة (CoT state transition) تحسينًا أقوى في تعميم التخطيط الطويل الأمد. تظهر النتائج أن المهارات الذرية وحدها غير كافية لتوليد تعميم تركيبي، بينما تساعد بعض البيانات طويلة الأمد على تحقيق ذلك. تتجلى مشكلة جديدة في أن المسارات غير المثلى تؤثر سلبًا على الأداء، حيث يمكن أن تضخم الأخطاء عبر الآفاق الزمنية الطويلة.
2. **تشكيل القدرة التخطيطية عبر GRPO وOPD بعد التدريب (post-training)**: تُستخدم المعلومات المتبادلة لتمييز الأنماط العامة للتخطيط عن المعرفة المحددة للمهام. يُظهر البحث وجود ثلاث مناطق تطبيقية للمعرفة التخطيطية ما بعد التدريب: غير الضرورية، الفعالة، وغير المدعومة. يسقط نموذج OPD ضمن منطقة فعالية أوسع مقارنةً بGRPO، حيث يقدم اتجاهات تحديث أكثر اتساقًا في بيئات ذات جودة منخفضة وآفاق زمنية طويلة.
3. **دمج القدرة التخطيطية عبر MOPD بعد التدريب**: يوضح الباحثون أن تقنية التقطير المعتمد على المعلمين المتعددين (multi-teacher on-policy distillation) تُدمج القدرات من خلال الانجذاب إلى أنماط تخطيط مشتركة عبر البيئات المختلفة. أنماط التوافق تدعم التعميم بين البيئات المختلفة، بينما تسبب الأنماط المتضاربة تمامًا تداخلًا شديدًا في الأداء.
تُمثل هذه الأبحاث مفتاحًا لفهم وتعزيز إمكانيات التخطيط لدى نماذج الذكاء الاصطناعي، مما يُمكنها من تحقيق أداء أفضل في المهام المعقدة.
إعادة ابتكار التخطيط الطويل الأمد: كيف يمكن لتحسين أساليب التعلم أن يغير مشهد الذكاء الاصطناعي؟
تسعى أحدث الأبحاث في مجال التخطيط الطويل الأمد إلى تحسين أداء نماذج الذكاء الاصطناعي من خلال تطوير بيئات تحكم دقيقة. هذه الدراسات تمثل تقدمًا هامًا في فهم كيف يمكن تعزيز قدرات التخطيط ضمن عمليات ما بعد التدريب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
