في عصر الإنترنت الصناعي للأشياء (IIoT) وأنظمة السيبرانية الفيزيائية (CPS)، يظهر التعلم الفيدرالي (Federated Learning) كنهج واعد لخلق ذكاء موزع في مجال كشف الشذوذ في الفيديو (Video Anomaly Recognition). يُعتبر هذا السؤال أساسياً للحفاظ على الدقة العالية للنماذج الرقمية التوأمية (Digital Twins) وضمان الأمان في البيئات الحيوية.

تواجه تحديات اساسية تتمثل في تباين البيانات لدى العملاء المنتشرين، مما يؤدي إلى حالة من عدم التوافق الدلالي (semantic misalignment)، حيث يقوم العملاء بتطوير تمثيلات متباينة لما يعد "طبيعياً" و"شاذاً". تبرز هذه المشكلة بشكل خاص في مجال كشف الشذوذ في الفيديو، حيث تتواجد فئات شاذة متنوعة ودقيقة، مما يجعل كل عميل يتخذ تفسيرات دلالية منفصلة لما يعتبر شذوذاً.

لا تسلط الطرق الفيدرالية الحالية الضوء على هذه المشكلة، حيث تركز في الغالب على الكشف الثنائي وتفشل في معالجة عدم التوافق هذا، مما يحول دون التعرف الدقيق. ولكن، في ورقة بحثية جديدة، نقدم FedVAR، وهو إطار تعلم فيدرالي تحت إشراف ضعيف مصمم خصيصاً لكشف الشذوذ في الفيديو (VAR).

استغلالاً للتمثيلات الغنية لنماذج الرؤية واللغة (Vision-Language Models)، يستخدم FedVAR آلية محورية قائمة على النماذج لإنشاء نقطة دلالية مشتركة لجميع العملاء لتعيد توجيه وتوحد مساحات الميزات البصرية والنصية لديهم. تعزز هذه العملية تمثيلاً متناسقاً لـ"الطبيعة" عبر الشبكة اللامركزية، مما يقلل بشكل مباشر من عدم التوافق الدلالي ويسمح بتعلم توجيه الشذوذ بأقصى قوة مع الحد الأدنى من الحمل الاتصالي.

أجرينا تجارب شاملة على مجموعات بيانات تحدي تحت أنظمة تقسيم بيانات غير IID (non-IID)، مجالات غير معروفة، وفئات شاذة جديدة. أظهرت النتائج أن FedVAR يتفوق باستمرار على الأساليب الفيدرالية الحالية، مما يؤسس إطاراً قوياً للذكاء الموزع في CPS القائم على الفيديو.