في عالم الذكاء الاصطناعي المتطور، تأتي أدوات وتقنيات جديدة لتغيير طريقة تعاملنا مع البيانات. في هذا السياق، يقدم الباحثون أحدث ابتكار في مجال التعلم الفيدرالي، وهو Fed-GRPO، الذي يعد ثورة في طريقة تدريب النماذج اللغوية الضخمة (Large Language Models - LLMs).
يعتبر Fed-GRPO إطارًا لتدريب نماذج التعلم الفيدرالي يعتمد على مجموعة من الإشارات المستندة إلى المكافآت، مما يتيح تدريبًا تعاونياً بدون الحاجة لمشاركة البيانات الأصلية. هذا التطور يرد على التحديات المتعلقة بالخصوصية والامتثال، حيث يسهم في تعزيز فعالية التعلم مع حماية المعلومات الحساسة.
النهج الذي يتبعه Fed-GRPO يعتمد على ثلاث آليات رئيسية تستند إلى إشارات المكافآت:
1. **التجميع المخفض بالإشارة**: حيث يتم وزن المشاركين حسب تباين المكافآت، مما يعزز من تعلّم المشاركين الأكثر فعالية.
2. **معايرة المكافآت العالمية**: تعمل على ضبط الأهداف لكل طلب بناءً على الفجوة بين المكافآت المحلية والعالمية، مما يساعد كل عميل على معالجة نقاط ضعفه.
3. **التواصل المتكيف**: يضمن تخصيص عرض النطاق الترددي استنادًا إلى جدوى تحديثات كل عميل، مما يدفع نحو تحسين فعالية التواصل.
من خلال تجربة مكثّفة على مهام التفكير الرياضي، أظهر Fed-GRPO تفوقًا ملحوظًا على كل الطرق الفيدرالية، متجاوزًا أداء FedAvg واقترب من مستوى أداء التدريب المركزي. كما يستطيع تقليل التواصل بفارق يصل إلى 32 مرة ويدعم حتى 621 مرة من ضغط البيانات ضمن قيود عرض النطاق الضيق.
إن الرؤية المستقبلية لـ Fed-GRPO تعد بدفع حدود الذكاء الاصطناعي نحو مزيد من الأمان والخصوصية دون التفريط في أداء النماذج. تستطيعون الاطلاع على الكود الخاص بهذا الإطار من خلال الرابط المرفق.
ثورة في الذكاء الاصطناعي: إطلاق Fed-GRPO لتحسين نماذج التعلم الفيدرالي
تم إطلاق Fed-GRPO، إطار عمل مبتكر لتحسين التعلم الفيدرالي مع الحفاظ على الخصوصية، مما يعزز أداء النماذج اللغوية الضخمة (LLMs). هذا الإطار يعد بتقليل تواصل البيانات بشكل كبير مع تحسين النتائج بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
