في ظل تزايد استخدام نماذج اللغة الضخمة (Large Language Models) على الأجهزة المحلية لأغراض الخصوصية والتكاليف ونوعية الوصول، يبرز السؤال: هل يجب أن نركز على الدقة أم على الكفاءة؟ تناولت دراسة قدمت على منصة arXiv الجديدة هذا الموضوع بشكل شامل.
تسلط هذه الورقة الضوء على أهمية تقييم نماذج LLMs المحلولة محليًا وليس فقط من خلال معيار الدقة. فقد قامت الدراسة بإعداد إجراءات موثقة مسيطرة لفحص القدرات الرياضية لهذه النماذج، مع الأخذ في الاعتبار سرعة التشغيل والطاقة المستهلكة.
تتضمن الدراسة اختبار ثلاثة نماذج مفتوحة الوزن، وهي: Gemma3:4b من Google وPhi3:3.8b من Microsoft وQwen3:4b من Alibaba. جميع النماذج تم التعامل معها من خلال سير عمل محلي مشترك، مما سمح بالمقارنات العادلة.
تشير النتائج الأولية إلى أن النموذج Qwen3:4b يعتبر الأكثر دقة في مجموعتين من البيانات، بينما جلب Gemma3:4b النتائج الأرجح على مستوى حساب التفاضل والتكامل. ولكن في المقابل، أظهرت Gemma3:4b قدرة أعلى في الإجابة الصحيحة مقارنةً بـ Qwen3:4b، مع استخدام أقل للروايات.
أما Phi3:3.8b، فقد أثبتت عدم دقتها بشكل ملحوظ عبر كافة المجموعات، مما يشير إلى أن النماذج ليست جميعها متساوية.
في النهاية، تؤكد الدراسة أن الاعتماد فقط على معيار الدقة لا يكفي في اختيار النموذج المناسب، بل يجب النظر في كفاءة الأداء واستهلاك الطاقة أيضًا.
ماذا تعتقد؟ هل تجد أن كفاءة النموذج أهم من دقته أم العكس؟ شاركنا بآرائك في التعليقات!
هل تفضل الدقة أم الكفاءة؟ تقييم نماذج اللغة المفتوحة المضغوطة لأغراض الرياضيات!
تسعى نماذج اللغة الضخمة إلى تحقيق التوازن بين الدقة والكفاءة في تنفيذ المهام الرياضية. ورقة جديدة تعرض نتائج دراسة تحلل كيفية أداء ثلاثة نماذج مفتوحة في ظروف محلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
