في عالم الذكاء الاصطناعي، يتزايد الاهتمام بتطوير النماذج القادرة على التعامل مع المهام المعقدة بكفاءة. في هذا السياق، يأتي تقرير جديد يستعرض أداء محرك Qiushi v0.8، والذي تم اختباره عبر 40 مهمة ضمن معيار AstaBench E2E-Bench-Hard.
يُعتبر AstaBench معيارًا يُقَيِّم قدرة الوكلاء المستقلين على معالجة أسئلة بحثية، بدءًا من تصميم التجارب وتنفيذ الأكواد، وصولاً إلى تحليل النتائج وتقديم التقارير. يتميز محرك Qiushi بكونه قابل للتكوين وفق نماذج مختلفة، حيث تم اختيار نموذج DeepSeek deepseek-v4pro-preview كخلفية لعملية التقييم.
أثبت محرك Qiushi كفاءة ملحوظة، حيث سجل درجة قدرها 0.816 بتكلفة وسطة للتقييم تبلغ 15.209 دولار لكل مهمة. وعلى الرغم من أن نسبة اكتمال المهام كانت 10% (مع استيفاء 4 من أصل 40 مهمة لكل العناصر المطلوبة)، فإن هذه النسبة تتجاوز بمقدار 7 نقاط مئوية معدل الأداء الأفضل المسجل رسميًا لوكلاء AstaBench.
تضمن التقرير تفصيلًا لنتائج الأداء كما يتناول العوامل المحددة التي قد تؤثر في الإنتاج المستدام والتحقق من التقارير والبيانات التجريبية. ومن المثير للاهتمام أن 82.1% من العناصر المطلوبة قد تم تلبيتها عبر 507 عنصر متطلبات.
بينما تحقق محرك Qiushi نجاحات ملحوظة، يبقى العمل مستمرًا لتحسين فرص الأداء، خاصة فيما يتعلق بالإعدادات المتكررة والاعتماد على المصادر الخارجية ومعايير القياس.
إذا كنت من المهتمين بتطورات الذكاء الاصطناعي، فما رأيك في هذه الاختراعات الحديثة؟ شاركونا بآرائكم في التعليقات!
محرك Qiushi: ثورة جديدة في اختبار الأداء للذكاء الاصطناعي!
تشهد تقنيات الذكاء الاصطناعي تطورًا ملحوظًا مع تقييم محرك Qiushi v0.8 في اختبارات AstaBench E2E-Bench-Hard. هذا التقرير يكشف عن إنجازات المحرك في تنفيذ مهام معقدة وتحليل النتائج بشكل احترافي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
