تتوسع الأبحاث في مجال نماذج الخبراء المختصين (Mixture-of-Experts - MoE) لتكشف عن تفاصيل جديدة تساهم في فهم ديناميات التوجيه داخل هذه النماذج. في أحدث الأعمال، تم استكشاف كيفية تأثر عمليات التوجيه في كل طبقة بالقرارات المتخذة في الطبقات السابقة. يشير البحث إلى أن هناك هيكلًا جيويميترًا مشتركًا يؤثر على قرارات التوجيه ولكن يتم إخفاؤه بسبب أنظمة إحداثيات خاصة بكل طبقة.
من خلال تطبيق تحليل بروكروستوس (Procrustes Analysis) العام، عُزلت الفضاءات التحكمية لكل موجه وتجانست في تمثيلٍ متكامل مشترك. بعد هذه التوافق، لوحظ أن نموذجًا خطيًا واحدًا يمكن أن يصل إلى فعالية تصنيف تصل إلى 0.71 مع الحفاظ على 79-90% من قوة التنبؤ الخاصة بالديناميات المخصصة لكل طبقة، مما يعني أن الكثير من تطور حالة التوجيه يتبع عملية قابلة لإعادة الاستخدام عبر العمق.
ثم تم تقييم ما إذا كانت هذه الديناميات المشتركة خاصة بالتوجيه أو تعكس ببساطة تطور التمثيلات المخفية. أظهرت المقارنات أن التمثيلات المتبقية أسهل بشكل ملحوظ في التنبؤ عبر الطبقات، بينما تحافظ حالات التحكم في الموجه على اختيارات الخبراء الخاصة بالنموذج بحرص أكبر. هذا يميز التنبؤ العابر للطبقات العامة عن المعلومات الخاصة بالتوجيه.
في النهاية، تم اختبار ما إذا كانت الحالات المتوقعة تحتفظ بمعناها عندما تُستخدم بدلاً من الحالات الأصلية. فقد أظهرت الحالات المنقولة سلوك التوجيه المحلي المطلوب، بينما أظهرت تطور الحالة المتعلم انخفاضًا في قيمة الخسارة الطبيعية بنسبة 15.7% بالنسبة لنموذج OLMoE و6.2% على مدى 10 موجهات في Phi.
بفضل هذه الدراسة، تتضح أهمية فهم التوجيه في نماذج MoE وما يمكن أن تعنيه هذه الأنماط لتطوير خوارزميات الذكاء الاصطناعي المستقبلية. ما رأيكم في هذه النتائج المثيرة؟ شاركونا في التعليقات!
تحليل مثير لكيفية تنسيق نماذج الخبراء المختصين: دليل للهيكل الجيومتري المشترك
تقدم دراسة جديدة رؤى عميقة حول كيفية تنسيق نماذج الخبراء المختصين من خلال تحليل هيكلها الجيومتري المشترك. تُظهر النتائج كيف تتشارك طبقات النموذج في توجيه القرارات وتعزز من دقة التنبؤ بها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
