في عالم الأمان السيبراني، يُعتبر تحليل البرمجيات العكسي (Reverse Engineering) جزءًا أساسيًا من ضمان سلامة البرامج، خاصة تلك التي تعتمد على التشفير للتعامل مع بيانات حساسة. إلا أن هذه العملية تتطلب خبرة كبيرة وتعد عملاً شاقًا، مما يجعل الحاجة ماسة لإيجاد حلول تكنولوجية تساعد في أتمتة هذا العمل. هنا تأتي الفائدة المحتملة لنماذج اللغة الكبيرة (Large Language Models) التي أظهرت قدرة في العديد من المجالات، لكن تطبيقها العملي في تحليل البرمجيات العكسي لا يزال غير مستكشف بشكل كافٍ.

لمعالجة هذه الفجوة، تم تطوير CREBench، وهو معيار يهدف إلى تقييم قدرات نماذج اللغة الكبيرة في تحليل البرمجيات التشفيرية. يتكون CREBench من 432 تحديًا مستندًا إلى 48 خوارزمية تشفير قياسية، بالإضافة إلى 3 سيناريوهات لاستخدام المفاتيح التشفيرية غير الآمنة و3 مستويات من الصعوبة. كل تحدٍ يُقام على نمط تحديات Capture-the-Flag (CTF)، مما يتطلب من النموذج تحليل المنطق التشفيري الأساسي واستعادة المدخل الصحيح.

لقد تم تصميم إطار تقييم يحتوي على أربع مهام فرعية، تتراوح من تحديد الخوارزمية إلى استعادة الشعارات بشكل صحيح. وقد تم تقييم ثمانية من نماذج اللغة الكبيرة على CREBench، حيث حققت يبرز النموذج GPT-5.4 كأفضل نموذج، حيث حصل على 64.03 من 100 واستطاع استعادة الشعار في 59% من التحديات. مقارنة بذلك، أظهرت الأساسيات البشرية الخبيرة أداءً قويًا، حيث حصلت على 92.19 نقطة، مما يؤكد أن الخبراء البشر لا يزالون يحتفظون بأفضلية في مهام تحليل البرمجيات التشفيرية.

مما لا شك فيه أن تطبيق CREBench يأتي ليجعلك تتساءل، هل سيمكن لنماذج الذكاء الاصطناعي أن تحل محل الخبراء البشر في هذا المجال؟ لمزيد من التفاصيل، يمكنك الوصول إلى الشيفرة المصدرية والمجموعة البيانية عبر [https://github.com/wangyu-ovo/CREBench].