في تطور مثير لعالم الذكاء الاصطناعي، تم الكشف عن تفاصيل جديدة حول ظاهرة "الغروك" (Grokking)، التي تشير إلى ظهور متأخر لعمومية البيانات الخاصة بالنموذج بعد أن يكون قد تجاوز مرحلة التكيّف مع مجموعة التدريب. وعلى الرغم من أن هذه الظاهرة لوحظت لأول مرة في المهام الصغيرة التي تعتمد على الخوارزميات والنماذج القائمة على المحولات (Transformers)، إلا أن الآلية الأساسية التي تحكمها لا تزال غير واضحة.
في هذا البحث، تم تطوير إطار تحليل يعتمد على الاتصال النمطي والهندسة المرتبطة بمناطق الخسارة المنخفضة. حيث يتوصل الباحثون إلى توقعات تشير إلى أن الإعداد القياسي للحسابات المودولية لا ينتج دائمًا ظاهرة الغروك؛ بل تحت تقسيم يحافظ على التناظر بين التدريب والتحقق، تم ملاحظة حالة مستقرة تعرف "بالتضاد الغروكي" (anti-grokking)، حيث لا يتعافى أداء التحقق.
تحدي هذه الحالة المضادة العديد من التفسيرات الارتباطية الحالية المرتبطة بتفسير الغروك. علاوة على ذلك، تشير نتائج تحليل هذه الظاهرة إلى أن الغروك يحدث عندما تكون مناطق الخسارة المنخفضة الناشئة عن تقسيمات التدريب والتحقق غير متناسبة. وبمجرد أن تصبح هذه المناطق في تناغم، فإن معلمات التدريب وحدها لا تكفي لإنتاج الغروك، وتؤدي الديناميكيات الملحوظة إلى سلوك قابل للتدريب أو غير قابل للتدريب.
إن فهم هذه الآليات الدقيقة يفتح آفاقًا جديدة للبحث في الذكاء الاصطناعي، ويستبدل المفاهيم الحالية حول كيفية عمل النماذج اللغوية، مما يدعو الباحثين والمطورين إلى إعادة التفكير في الطرق التي يتم بها تصميم وتدريب هذه النماذج.
اكتشاف جديد يكشف عن آلية ظاهرة الغروك (Grokking) في نماذج الذكاء الاصطناعي!
في تحليل ثوري، يكشف الباحثون عن مفاتيح ظاهرة الغروك (Grokking) وكيفية تأثير عدم التوافق بين مناطق الخسارة المنخفضة على أداء النماذج. أدوات دقيقة تُسلط الضوء على أبعاد جديدة لفهم النماذج اللغوية!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
