في عالم التكنولوجيا المتطورة، تزداد أهمية مساعدي البرمجة مثل Claude Code وCodex، حيث تحظى هذه البرمجيات بشعبية متزايدة لدى المطورين. لكن، بالرغم من هذه الشعبية، لا تزال المعايير الحالية لتقييم هذه المساعدات بعيدة عن الواقع العملي، خاصةً فيما يتعلق بمدى المهام وطول تفاعلات المستخدم.

لكي نحل هذه المشكلة، أُطلق مشروع جديد يحمل اسم SWE-Journey، الذي يعد معياراً جديداً للتقييم الواقعي لمساعدي البرمجة. يركز هذا الابتكار على أهمية التعامل مع تغيرات مستمرة في مستودعات التطوير، حيث يحتاج المستخدمون إلى توضيح المتطلبات والتكيف مع المتغيرات عبر تفاعلات متعددة.

في هذا السياق، يقترح فريق SWE-Journey استخدام خط أنابيب من الضعيف إلى القوي، حيث يقوم بتوليد مهام برمجية طويلة الأمد بشكل تلقائي. بأخذ ذلك في الاعتبار، تم تجميع بيانات حقيقية من تفاعلات المستخدمين وتم تطوير وكيل محاكاة لتكرار تفاعلات واقعية للمساعدات البرمجية.

تشير النتائج الأولية إلى أن النماذج قادرة على اجتياز أكثر من 75% من الاختبارات مع المهندسين المعماريين البرمجيين، لكنها تفشل في اجتياز 25% فقط مع المستخدمين غير المبرمجين. يبدو أن المساعدات البرمجية الحالية لا تزال تحتاج إلى تحسينات كبيرة لتكون فعالة وصالحة للاستخدام من قبل غير المختصين.

بمزيد من التحليل، تم تحديد النقاط الرئيسية للتفاعل، مثل كيفية طرح الأسئلة الصحيحة، والعثور على الحلول المناسبة، وتصحيح الأخطاء، باعتبارها القدرات الأساسية لضمان تجربة مستخدم فعّالة.

تظهر هذه الجهود المستمرة أهمية الفهم العميق لاحتياجات المستخدمين، وضرورة تحسين أداء مساعدي البرمجة لتلبية متطلبات الجميع.