في عالم تعلم الآلة، تتميز معمارية Transformer بقدرتها الفائقة على نمذجة تسلسل البيانات بفضل آليات الانتباه القوية التي تقدمها. ولكن في المهام المتعلقة بتتبع الحالات الحتمية مثل فحص التماثل (parity checking) وعدّ المودولار (modular counting) ومطابقة الأقواس (parenthesis matching)، قد يُعتبر استخدام آلية الانتباه مبالغة.

في هذا الإطار، يعرض الباحثون نموذج مُرسل الحالة المعقد (CSP) كبديل مبتكر. يعتمد هذا النموذج على هيكل متكرر بسيط يقوم بنقل الحالات الخفية (hidden states) عبر الطبقات دون الحاجة إلى عمليات إخراج في الخطوات الوسيطة. يتم تمثيل الحالة كمتجه ذو قيم معقدة، حيث يتم تحديثه من خلال دورانات تعتمد على المدخلات في المجال المعقد.

لضمان النقل العميق دون فقدان التدرجات أو تدهورها، تم تقديم اتصال تخطي على مستوى الكتل مع تطبيع معقد عنصرًا عنصرًا (element-wise complex normalization) وتنشيط SiLU عند حدود التسلسل. هذا التطبيق، مدعومًا بخسارة مركزة (Focal Loss)، أدى لتحقيق دقة مثالية تصل إلى 100% بناءً على المهام التقليدية.

إن النموذج الجديد يعد خطوة كبيرة نحو تحسين نمذجة التسلسل ويعزز كفاءة تطبيقات متعددة في عدة مجالات.

هل تعتقد أن هذا التقدم سيغير طريقة تفكيرنا حول استخدام نماذج التعلم العميق في المستقبل؟ شاركونا آراءكم!