في عالم البرمجة، تُعتبَر نماذج اللغة الضخمة (Large Language Models) من النقاط المحورية للابتكار، لكنها تواجه تحديات كبرى عند التعامل مع لغات برمجة منخفضة الموارد. ولهذا السبب، تم تقديم CangjieBench، وهو معيار جديد يُعدّ الأول من نوعه لقياس أداء نماذج اللغة الضخمة في هذا المجال.
تُركز الأبحاث الحالية بشكل رئيسي على اللغات المتخصصة (Domain-Specific Languages)، مما يُخلف اللغات العامة تعاني من نقص البيانات دون استكشاف كافٍ. **CangjieBench** يُعالج هذه الفجوة من خلال تقديم معيار خالٍ من التلوث لقياس أداء Cangjie، وهي لغة برمجة عامة منخفضة الموارد.
يتضمن المعيار 248 عينة عالية الجودة تم ترجمتها يدويًا من HumanEval وClassEval، مما يغطي مجموعة من المهام، بما في ذلك تحويل النص إلى كود وتحويل الكود إلى كود. أُجريت تقييمات منهجية لمجموعة متنوعة من نماذج اللغة الضخمة تحت أربعة إعدادات:
- **التوليد المباشر (Direct Generation)**
- **التوليد مع قيود التركيب (Syntax-Constrained Generation)**
- **التوليد المعزز بالاسترجاع (Retrieval-Augmented Generation - RAG)**
- **الوكيل (Agent)**
أظهرت التجارب أن الأداء في التوليد المباشر كان ضعيفاً، بينما قدم التوليد مع قيود التركيب أفضل توازن بين الدقة وتكاليف الحوسبة. وعلى الجانب الآخر، حقق الوكيل أعلى دقة لكنه استهلك عددًا كبيرًا من الرموز.
من الملاحظ أيضاً أن ترجمة الكود إلى كود غالبًا ما كانت أدائها أقل من توليد النص إلى كود، مما يشير إلى ظاهرة نقل سلبية حيث تميل النماذج إلى التفوق على أنماط اللغة المصدر.
نأمل أن يوفر هذا العمل رؤى قيمة حول تعميم نماذج اللغة الضخمة للغات البرمجة منخفضة الموارد وغير المرئية. يمكنكم زيارة github للاطلاع على الكود والبيانات المتاحة.
CangjieBench: نقلة نوعية في تقييم نماذج اللغة الضخمة للغات البرمجة منخفضة الموارد!
تسعى CangjieBench إلى سد الفجوة في تقييم نماذج اللغة الضخمة (LLMs) للغات البرمجة منخفضة الموارد، حيث تقدم دليلاً مبتكراً للتغلب على التحديات التي تواجه هذه اللغات. تتضمن الدراسة تجارب شاملة تكشف عن الأداء المتفاوت لنماذج مختلفة في مهام متنوعة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
