في عصر تتصاعد فيه التعقيدات في طلبات البحث، تحتاج نماذج الذكاء الاصطناعي، وخاصة نماذج اللغات الضخمة (Large Language Models)، إلى قدرات عميقة للتعامل مع المعلومات وتحليلها واستخراج إجابات قائمة على الأدلة. ومع ذلك، واجهت الوكلاء الحالية المبنية على أسلوب ReAct عدة تحديات، أهمها التداخل بين الأدوار، حيث تضطر سياسة واحدة للتعامل مع التخطيط والمعلومات والتركيب في آن واحد. هذا بجانب عدم كفاءة تراكم المعلومات السياقية، والذي يؤدي إلى إدخال الضجيج ويعيق استخراج المعلومات المفيدة.
لذا، تم اقتراح IterSynth كنموذج جديد، والذي يعتمد على الفصل بين الأدوار وتقنية التلخيص. يقوم IterSynth بالتناوب بين "المخطط" الذي يحدد احتياجات المعلومات و"الملخص" الذي يجمع الأدلة في حالة تلخيص متطورة؛ مما يقلل من الارتباط بين القدرات والضجيج السياقي. للتحقق من فعالية تدريب IterSynth، تم تقديم أسلوب تحسين السياسة المعزولة (Role-Decoupled Policy Optimization - RDPO) في التعلم المعزز، الذي يجمع بين المكافآت الناتجة النهائية مع تقييمات محورية لكل جولة، مما يؤدي إلى تحسين تخصيص الأفضليات لكل دور.
أظهرت التجارب على خمسة من معايير البحث العميق طويلة الأمد مثل BrowseComp وXbench-DS أن IterSynth-8B تحقق متوسط درجات قدره 50.7، متفوقة على أقوى الوكلاء السابقين بأكثر من 4.2%. بالإضافة إلى ذلك، يعمل IterSynth كنموذج مستقل عن النماذج، مما يوفر مكاسب كبيرة بدون تدريب مسبق مقارنة بأساليب ReAct ونماذج مشابهة على النماذج الخاصة المتقدمة. هذا ما يجعل من IterSynth علامة بارزة في مجال الذكاء الاصطناعي للبحث العميق، ويشير إلى مستقبل واعد في هذا المجال.
اكتشاف IterSynth: إعادة التفكير في وكلاء البحث العميق باستخدام تطوير الأدوار المستقل
تم تقديم IterSynth كنموذج جديد في مجال البحث العميق، يحل مشكلات الجمع بين الأدوار داخل الوكلاء ويوفر ملخصات متكاملة. النتائج الأولية تشير إلى فاعلية هذا النموذج في تحسين أداء البحث بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
