في عالم الذكاء الاصطناعي، تظهر العديد من الابتكارات التي تعزز من قدرة النماذج على التعلم والتفاعل معًا. تم مؤخراً تقديم مفهوم جديد يعرف باسم Stackelberg Alignment، والذي يعتمد على نظرية الألعاب لتطوير التعاون بين نماذج اللغات الضخمة (Large Language Models).
في بنية جديدة تعتمد على التعلم الجماعي، يتمكن مجموعة من نماذج اللغات من تحسين أدائها عبر تعلّمها من ردود بعضها البعض. تتمحور هذه العملية حول التعليمات المعطاة للنماذج وكيفية استخدامها أثناء التدريب. بينما كانت الطرق الحالية تعتمد على أخذ عينات تعليمات موحدة، فإن هذا المنهج الجديد يتجاوز ذلك لرسم نهج تعليمي متكيف يتناسب مع تطور النماذج.
تعتمد عملية Stackelberg Alignment على نموذج قائد يتولى مسؤولية تخصيص ميزانية ثابتة لاختيار التعليمات، مع تحديث توزيع نماذجها وفقًا لمكافأة تجمع بين صعوبة التعليمات وتمييز الردود. بينما تعمل نماذج اللغات كمتابعين، حيث تقوم بالاستجابة للتعليمات المختارة، تقييم ردودها على بعضها البعض، والتعلم من إشارات التفضيل الناتجة عبر تقنيات مثل DPO و GRPO.
تم إجراء تجارب على ثلاث مجموعات من النماذج المختلفة و12 معيارًا تشمل اكتشافات علمية، تفكير منطقي، تعليمات، ومعرفة. وأظهرت النتائج أن Stackelberg Alignment تحقق أفضل متوسط إجمالي عبر هذه المجموعات، متفوقة على نموذج التدريب الأقوى بنسبة تصل إلى 7.4% وعلى نموذج الاستدلال الثابت بنسب تتراوح بين 12% و25%.
يشير تحليل البيانات إلى أن القائد التكاملي يركز التحديات على التعليمات الأكثر إفادة، مما يعزز من فعالية تطور نماذج اللغات.
برأيك، كيف يمكن لهذه الابتكارات أن تؤثر على مستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!
إطلاق منصة جديدة لتحسين التعاون بين نماذج اللغات الضخمة: Stackelberg Alignment!
تقدم دراسة جديدة مفهوم Stackelberg Alignment الذي يحسن التفاعل بين نماذج اللغات الضخمة عبر نظام تعليمي مرن. هذا الابتكار يعد خطوة هامة نحو تعزيز الأداء الجماعي لنماذج الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
