في عالم الذكاء الاصطناعي، تعتمد الكثير من الخدمات على نماذج اللغات الضخمة (Large Language Models - LLM) لتقديم تجارب سريعة وفعالة. ولكن مع زيادة الطلب على خدمات الذكاء الاصطناعي، أصبح من الضروري تقليل زمن الاستجابة أثناء تنفيذ الطلبات. ولذلك، فقد تم تطوير إطار عمل جديد يهدف إلى تحسين جدولة الطلبات لتقليل زمن الاستجابة وتحقيق توزيع متوازن للحمل عبر خوادم edge.
تواجه هذه العملية تحديين رئيسيين. الأول هو أن النماذج التقليدية لزمن الاستجابة لا تستطيع أن تعكس بدقة الديناميكيات الدقيقة لتنفيذ نماذج LLM متعددة المراحل. الثاني هو أن نتائج قرارات الجدولة لا تُلاحظ إلا بعد انتهاء الطلب، مما يجعل من الصعب تقييم قرارات الجدولة بشكل فوري.
لتجاوز تلك التحديات، تم ابتكار نموذج استنتاج عبر الفترات الزمنية، والذي يلتقط مراحل التنفيذ المختلفة ويقيس استهلاك الذاكرة والطاقة لخوادم edge. وتم تقديم نهج LYREO، الذي يعيد تشكيل قيود التوازن بين الأحمال عبر استخدام تحسين ليابونوف (Lyapunov optimization) ويوظف إعادة توزيع المكافآت لتوليد إشارات تعلم مبكرة.
أظهرت المحاكاة تحت تكوينات مختلفة أن LYREO يحقق باستمرار زمن استجابة أقل وتوزيعًا أكثر توازنا للأحمال مقارنة بالأساليب التقليدية المعتمدة على التعلم.
ثورة الذكاء الاصطناعي: تقنيات جديدة لتقليل زمن الاستجابة وتحسين توزيع الأحمال!
تبحث دراسة حديثة في إطار جديد لتحديد الطلبات في خدمات الذكاء الاصطناعي القائم على نماذج اللغات الضخمة (LLM)، مما يسهم في خفض زمن الاستجابة وتحسين توزيع الأحمال. نهج LYREO يقدم حلاً مبتكرًا لهذه التحديات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
