أحدثت وكالات الذكاء الاصطناعي (AI agents) نقلة نوعية في قدراتها في مجال الأمن السيبراني، خاصة عندما يتوفر الكود المصدري للتحليل. ولكن، هناك العديد من البرمجيات الضرورية في هذا المجال، مثل البرمجيات الخبيثة والبرامج الثابتة، التي تكون متاحة فقط كإصدارات ثنائية (binaries).

يتطلب تحليل هذه البرمجيات عملية المراجعة العكسية (Reverse Engineering)، حيث يلزم استعادة معاني البرامج قبل أن يتمكن المحلل من البدء بعمله بشكل فعّال. ومع ذلك، تطرح مشكلة أساسية فيما يتعلق بتقييم وكالات المراجعة العكسية: يجب أن تكون حالات المعيار غير مرئية ككود مصدري في بيانات تدريب نماذج اللغة الكبيرة (LLMs) لتفادي استخدام النماذج لحيل التعرف بدلاً من التحليل الحقيقي.

وعليه، تم تقديم SRE-Bench، أول معيار واقعي ومجاني من التلوث للمراجعة العكسية. تم بناؤه بالكامل من قبل خبراء Reverse Engineering، ويشمل 19 برنامجًا خاصًا حقيقيًا بمعدل 16.9 ألف سطر من الكود. كما تم تطوير 44 عنصرًا مضادًا للتحليل، مما أسفر عن 262 حالة ثنائية و1572 مهمة تم تقييمها بشكل حتمي.

أظهرت تقييماتنا عبر خمس نماذج رائدة من LLMs، بما في ذلك GPT-5.6-sol وClaude-Opus-5، أن المراجعة العكسية لا تزال تواجه تحديات كبيرة. حيث حقق النموذج الأقوى، GPT-5.6-sol، نسبة نجاح تبلغ 61.4% فقط لكل حالة، وحل 31.5% فقط من الحالات بالكامل.

تكشف تحليلاتنا أيضًا أن الوكالات تتصرف بشكل مختلف عن المهندسين البشريين، حيث تبين أنها أكثر عدم حساسية لتحسينات المترجم والتوصيل الثابت. تدعم التجارب المنضبطة أيضًا أن التحكم في التلوث والمقياس الواقعي يعدان أمرين أساسيين.

تشير هذه النتائج إلى أن القدرات القوية في أمان الكود المصدر لا تنتقل بعد إلى تحليل البرمجيات الثنائية، مما يجعل المراجعة العكسية منطقة جديدة وهامة لتحدي الأمن السيبراني. وSRE-Bench توفر منصة اختبار صارمة لقياس التقدم في هذا المجال.