تعتبر الأجهزة المتصلة (IoT) جزءًا محوريًا من حياتنا اليومية، ولكن هل يكفي وجود خوارزمية أمانية قوية فقط؟ بالفعل، فالمهاجم الذي يمتلك وصولًا فعليًا إلى الجهاز يمكنه استغلال ثغرات التنفيذ، مما يجعل من الضروري تقييم هذه الأنظمة بشكل شامل. هنا تبرز أهمية CESBench، الأداة الجديدة المخصصة لقياس أداء نماذج اللغات الضخمة (Large Language Models) في أمان تقنيات التشفير.

CESBench تتضمن 380 مادة مكثفة تم إعدادها من قِبل خبراء في مجال أمان تشفير الأجهزة المتصلة، تغطي ستة مجالات فرعية تشمل: هجمات القنوات الجانبية (side-channel)، حقن الأخطاء (fault injection)، التنفيذ (implementation)، تدابير الحماية (countermeasures)، التقييم (evaluation)، والتكامل (integration). تتنوع المهمات المعروضة بين خيارات متعددة، حيث تم تصميم 209 مهمة لاختيار من متعدد تقيس استرجاع المعلومات، و67 مهمة تتطلب حكمًا أمنيًا وتبريره، بالإضافة إلى 63 سيناريو يتطلب تشخيصًا هندسيًا، و41 مهمة برمجية يتم تقييمها باستخدام 572 حالة اختبار.

لتأكيد جودة القياس، تم اختبار 11 نموذجًا من نماذج اللغات الضخمة المفتوحة والمملوكة على جميع العناصر. تُسجل إجابات الخيارات المتعددة والبرمجة تلقائيًا، بينما تُقيّم إجابات الحكم والسيناريو بواسطة نموذج لغة آخر يقوم بالتقييم، وتُقارن درجاته مع نموذج بشري. تتراوح الدرجات التراكمية ما بين 54.4% إلى 83.6%.

على الرغم من أن أعلى نتيجة في كل نوع من التطبيقات بلغت 98.6% للخيارات المتعددة و95.1% للأكواد، إلا أن التبرير للحكم كان الأقل أداءً، بنسبة 58.8%. تشير النتائج إلى أن 88.5% من الأحكام كانت صحيحة، إلا أن المبررات لم تتجاوز 53.4% من العلامات المخصصة.

يعتبر CESBench أداة مفتوحة تعكس مستوى نماذج الذكاء الاصطناعي في مجال أمان الأجهزة الذكية، وتبين الحاجة إلى مزيد من العمل لتعزيز قدرتها على تبرير القرارات الأمنية. تعتبر هذه المنصة ثمرة جهد جماعي من الباحثين وتحمل في طياتها إمكانيات كبيرة لمستقبل أمان التقنيات المتصلة.