أصبح استخدام نماذج اللغة الكبيرة (LLMs) في تطوير البرمجيات المدمجة مهمًا بشكل متزايد، حيث تعمل هذه النماذج كعملاء برمجة تقوم بتحرير الملفات وتشغيل الاختبارات وإصلاح البرمجيات بشكل متكرر. يمثل تطوير البرمجيات المدمجة تحديًا كبيرًا، لأن الدقة تتطلب سلوكًا مغلقًا تحت قيود الحساسية والتوقيت والأمان، وليس فقط جودة المصدر الثابت.
إلا أن تقويم وكيل البرمجة المدمجة لا يزال محدوداً ويميل غالباً إلى التركيز على التوليد لمرة واحدة أو الدقة غير المتصلة. في هذا السياق، نقدم معيارًا جديدًا لتقييم الأداء المغلق لوكلاء البرمجة المدمجة. يتضمن كل مهمة وصفًا هندسيًا بدائيًا، وموارد عمل مقيدة، وسطح بناء وتشغيلي مرئي. يجب على الوكيل تحويل المتطلبات إلى خطوات التنفيذ والتحقق الذاتي، ثم يكرر العملية حتى يتم تحقيق السلوك المطلوب للجهاز.
تحتوي المجموعة على خمس مهام للتحكم المدمج وأربع سيناريوهات للتغذية الراجعة: التوليد لمرة واحدة، والتحقق الذاتي الواقعي، وتغذية راجعة نمط CI بنمط الأحمر/الأخضر، وتغذية راجعة مفصلة بأسلوب Oracle. تستهدف التنفيذات البرمجيات الأساسية لمحاكاة ESP32 للتكرار.
لقد قمنا بتقييم سبعة تكوينات من عائلات GPT وعائلة Qwen عبر خمس مهام وأربع سيناريوهات، مع ثلاث تكرارات لكل شرط، ليكون لدينا 420 عملية تشغيل. أظهرت نتائج التقييم أن النموذج GPT-5.4 حقق أعلى معدل نجاح بين التكوينات التي تم تقييمها، ولكنه لم يستنفد المعيار. في حين أن نموذج Qwen3.5-27B ظهر كأقوى نموذج محلي تم رصده، وتعرضت النماذج المحلية الأصغر لانخفاض حاد في معدل النجاح وكفاءة البحث.
تشير هذه النتائج إلى أن الوكلاء المحليين القادرين على البرمجة المدمجة باتوا يظهرون في السوق، مما قد يفتح آفاقًا جديدة في تطوير البرمجيات.
ثورة نماذج اللغة: تقييم مغلق لوكلاء البرمجة في تطوير البرمجيات المدمجة
تقدم نماذج اللغة الكبيرة (LLMs) تقنيات جديدة لتطوير البرمجيات المدمجة، مع التركيز على تقييم الأداء في بيئات مغلقة. تُظهر النتائج إمكانيات هائلة لوكلاء البرمجة المحليين في تحقيق السلوك المطلوب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
