تستمر تهديدات التصيد الإلكتروني (Phishing) في التطور بسرعة، حيث تسجل أحجام الهجمات مستويات قياسية. يعود السبب وراء ذلك إلى توافر مجموعات أدوات التصيد (Phishing Kits) والقوالب القابلة لإعادة الاستخدام، مما يمكّن المهاجمين من إنشاء وتوزيع عدد كبير من الصفحات الاحتيالية بسرعة. ورغم أن خصائص الصفحات قد تختلف على السطح، إلا أن هياكلها الأساسية تُظهر غالبًا تشابهًا كبيرًا.

للأسف، تعتمد معظم وسائل الدفاع الحالية على قوائم حظر تفاعلية أو نماذج تصنيف مُعتمدة تُركز على حالات التصيد الفردية، مما يُحدّ من قدرتها على تحديد إعادة استخدام الهياكل وكشف الحملات المنسقة للتصيد. ولتجاوز هذه القيود، تستعرض الدراسة الحالية إمكانية استخدام هيكل HTML كوسيلة قوية لتحديد إعادة استخدام قوالب التصيد.

تُعتبر صفحات الويب عبارة عن أشجار كائن المستند (DOM Trees)، حيث يتم استخراج الخصائص الهيكلية وتغنيتها بمعلومات المحتوى بناءً على وسوم HTML. يتم بعد ذلك تجميع هذه التمثيلات باستخدام طرق التعلم غير الخاضع للإشراف لتجميع الصفحات الويب المتشابهة هيكليًا. تم تقييم ثلاثة خوارزميات تجميع ومقارنتها، بينما تم تحليل كيف يؤثر عمق شجرة DOM المستخرجة على تشكيل المجموعة وأداء التجميع بشكل عام.

بالإضافة إلى ذلك، تم تقييم جودة المجموعات بشكل يضمن كفاءة عن طريق استخدام مقياس المسافة جكار (Jaccard Distance Score) المدعوم بفحص يدوي يعزز أدوات التصوير البصري. تظهر النتائج أن التمثيلات الهيكلية لصفحات الويب يمكن أن تكشف بفعالية عن التشابهات المخفية بين مواقع التصيد، مما يُعزز من القدرة على اكتشاف قوالب جديدة تتعرض للتهديدات وتدعم تحليل التهديدات المنسقة.