في عالم الذكاء الاصطناعي، تواجه نماذج اتخاذ القرار المتسلسلة تحديات كبيرة تتعلق بالاعتماد على المعلومات الطويلة الأمد. ففي حين تعاني الشبكات العصبية المتكررة (RNNs) من مشكلة تلاشي التدرجات (vanishing gradients)، فإن النماذج المستندة إلى المحولات (Transformers) تواجه قيودًا بسبب التوسع التربيعي للاهتمام (attention). لمعالجة هذا التحدي، ظهرت تقنية جديدة تُعرف بإطار 'تدريب الزمن الاختباري' (Test-Time Training - TTT)، التي تخزن الذكريات الحلقية في معلمات الشبكة العصبية عبر هبوط التدرج خلال مرحلتي التدريب والاختبار.
على الرغم من نجاح هذه التقنية في مجال معالجة اللغة الطبيعية، لم يتم تطبيقها بعد في مجال التعلم التعزيزي (Reinforcement Learning - RL). في دراستنا الجديدة، نقدم نموذج 'ديكشن تيتان'، الذي يعزز نموذج 'ديكشن ترانسفورمر' (Decision Transformer) باستخدام طبقات TTT.
قمنا بتحليل أداء وخصائص 'ديكشن تيتان' في بيئة 'إكس ميز' (X-Maze)، التي تم تصميمها لاختبار الذاكرة التسلسلية. النتائج أظهرت أن 'ديكشن تيتان' قادر على تعلم الاعتمادات الطويلة الأمد بمدى يصل إلى 20 مرة أطول من نافذة السياق (context window) ، كما يمكنه التعميم على أطوال تصل إلى 1.7 ضعف البيانات التدريبية. ومع ذلك، يعتمد التعميم الزمني على توافقيات الزمن المستخدم، وقدرة النموذج على تعلم الاعتمادات الطویلة تعتمد على كيفية تشفير المعلومات ذات الصلة. هذه النتائج تفتح آفاقًا جديدة لفهم كيفية تحسين التعلم الآلي في تطبيقات متعددة.
ديكشن تيتان: ثورة في تدريب الذكاء الاصطناعي على الذاكرة طويلة الأمد
تقديم نموذج 'ديكشن تيتان' الذي يتيح للذكاء الاصطناعي التعلم من ذكريات طويلة الأمد باستخدام إطار تدريب جديد. هذه التقنية تتحدى القيود التقليدية وتفتح آفاقًا جديدة في تعلم الآلة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
