في عالم الذكاء الاصطناعي، يعتبر تجهيز نماذج اللغات الضخمة (LLMs) بالقدرات على استدعاء الأدوات المتعددة المهام خطوة أساسية نحو بناء وكالات مستقلة. ولكن، كانت هناك قيود مفصلية تقيد التقدم، بسبب الاعتماد على تقليد المسارات الكاملة. في المهام التي تتضمن أهدافاً فرعية غير مرتبة، يتشكل فضاء الحلول الأمثل في شبكة لؤلؤية كبيرة ومعقدة.

بالقيام بفرض هذه الطوبولوجيا الثرية على مسارات أحادية، يتعرض النظام للانهيار الشديد، مما يعاقب بشكل عشوائي الاستكشافات البديلة السليمة ويقلل من تنوع السياسات بشكل كبير. للمعالجة هذا التحدي، نقدم DART-SD (استرجاع المعلومات وتعديل التعلم الذاتي وفقاً للطوبولوجيا اللؤلؤية)، وهو إطار عمل مبتكر يُغير من النموذج التقليدي إلى تصحيح محلي موجه بالطوبولوجيا.

تبدأ DART-SD بتصوير عملية التنفيذ كجراف تفاعلي متقارب يعرف باسم Graph Transition State Interaction (ISTG)، ما يلتقط بدقة الطوبولوجيا اللؤلؤية للطرق الاستكشافية الناجحة والفاشلة. خلال التجارب الذاتية الآلية، يُحدد الإطار نقطة الانقطاع الطوبولوجي الحرجة (CTB) ويسترجع المراجع المعتمدة على النجاح.

أخيرًا، نقدم نموذجًا تدريجيًا للتعلم الذاتي بحيث يكون الإشراف المحلي مرشدًا لتوجيه التعليمات من خلال CTB، مما يضمن أن خسائر التدريب تُحسب فقط على الخطوات العائدة المولدة، مع الحفاظ بحزم على النقاط المنطقية السليمة من التحديثات المدمرة. تظهر التجارب على معيار المكالمات متعددة الأدوار المعقدة أن DART-SD يتفوق بشكل كبير على الأسس التقليدية التي تعتمد على المسارات الكاملة.