في دراسة جديدة مثيرة، تم تطبيق نظرية مصفوفة مارشينكو-باستور (Marchenko-Pastur) على أوزان الانتباة لنماذج التحويل المدربة مسبقاً. الهدف من هذه الدراسة هو فصل كل مصفوفة إسقاط إلى جزء يماثل السلوك العشوائي ومجموعة من النقاط الطيفية غير الاعتيادية. هذه العملية تم إثباتها بشكل سببي، حيث أدى إلغاء النقاط المحددة من قبل نظرية MP في نموذج "Mistral-7B" إلى أداء قريب من الحظ العشوائي في مهام مثل "HellaSwag" و"MMLU" و"PIQA". في المقابل، كان لإلغاء مجموعة متطابقة في القيم المفردة الثابتة تأثير ضئيل ولكنه ملحوظ.
عبر تحليل 11 نموذج تحويل مدرب مسبقاً، استطاع الباحثون تحديد خمسة أنماط متكررة: النقاط الطيفية غير الاعتيادية تحمل مكوناً مهيمناً من البنية المتعلمة؛ الإسقاطات "Q" تحمل أكثر النقاط الغير اعتيادية؛ الإسقاطات "V" تحت انتباه الاستعلامات المجمعة تفتقر إلى فصل واضح بين الإشارة والضوضاء؛ النقاط الغير اعتيادية تشكل أشرطة هيكلية في "Q" وأشرطة عمودية في "O"؛ وأبعاد معينة في تيار المتبقي تستمر كدلالات غير اعتيادية عبر الطبقات في "K" و"O".
هذه الاكتشافات قد تساهم بشكل كبير في تحسين تقنيات الضبط الدقيق وكفاءة المعلمات في نماذج التعلم العميق، مما يفتح آفاق جديدة للبحث والتطوير في هذا المجال الرائد.
اكتشافات مذهلة: كيف تكشف النقاط الطيفية عن بنية متعلمة مهيمنة في انتباه الموديلات التحويلية!
استكشفت دراسة جديدة العلاقة بين النقاط الطيفية في وزن الانتباة لنماذج التحويل، مؤكدة على دورها الكبير في فهم البنية المتعلمة. النتائج تبشر بإمكانيات جديدة لتحسين دقة النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
