في عالم التداول الآلي، يعتبر تقييم وكلاء البرمجة أمراً صعباً، حيث أن المعايير الثابتة قد تؤدي إلى تلوث البيانات، بينما تتطلب النتائج الرقمية من الاختبارات الخلفية (Backtest) الحصول على حقائق من تنفيذ الشيفرة الفعلي. هنا يأتي دور Backtrader-Bench، الإطار الأكثر تميزاً الذي يقدم طريقتين تكميليتين.
المسار الأول هو مسار الأسئلة متعددة الخيارات (MCQ)، والذي ينشئ أسئلة من تكوينات الاختبار الخلفي عبر خمس استراتيجيات تداول، و33 نموذجاً، وثلاث درجات من الصعوبة. يتم مراجعة كل إجابة من قبل مدقق مستقل لمراجعة الدقة.
أما المسار الثاني، فهو مسار التصفية الخاص بالمولد - المحلل، الذي يستخرج أسئلة أصعب بشكل تلقائي. حيث يقوم مولد بكتابة الأسئلة التي يحققها الكود القابل للتنفيذ، ويحولها إلى أسئلة متعددة الخيارات، ويتخلص من أي سؤال يمكن حله بواسطة أداة بدون تنفيذ الكود.
في تقييمنا، قمنا باختبار 11 نموذجاً بدون أدوات (عشر مرات لكل منها) وأربعة تكوينات مع أدوات على مجموعة من 30 سؤالاً مختاراً بعناية. وقد حقق الوكلاء المدعومون بالأدوات دقة تصل إلى 90.0% في مرور واحد، مثل نماذج GPT-5.5 وOpus 4.7، متفوقاً على أفضل الأسس غير المدعومة بالأدوات بفارق 17 نقطة مئوية.
علاوة على ذلك، خلال الاختبارات على 38 سؤالاً تم استخراجها بشكل منفصل، انخفضت دقة النماذج غير المدعومة بالأدوات بشكل أكبر، حيث انخفض أداء نصف النماذج إلى مستوى عشوائي تقريباً (25%).
تتجاوز إمكانيات Backtrader-Bench مجرد التقييم، حيث تم تصميم هيكل البنية القابلة للتوسع لإنتاج مجموعة تدريب لتعلم التعزيز، بهدف نهائي لبناء وكيل متخصص في سير العمل الخاصة بالتداول الكمي.
تطوير Backtrader-Bench: ثورة في تقييم وكلاء الذكاء الاصطناعي في التداول الآلي!
تم إطلاق Backtrader-Bench كإطار عمل جديد لتقييم وكلاء البرمجة باستخدام أسئلة متعددة الخيارات يتم توليدها ذاتياً، مما يحقق نتائج مذهلة في دقة التداول. هذا النظام يتيح تطوير وكلاء خاصين بتداول البيانات الكمية بفعالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
