تشهد مجالات البرمجة اعتمادًا متزايدًا على الوكلاء الذكائيين (AI Agents) لإنتاج كود برمجي، لكن يظل ضمان صحة هذا الكود نقطة ضعف رئيسية. وهنا تبرز أهمية مفهوم التوليد المؤكد للكود، حيث يقوم الوكيل بإنتاج كل من التنفيذ وإثبات موثوق لمواصفات هذا التنفيذ، مما يوفر مسارًا أقوى نحو برنامج موثوق يعتمد على الذكاء الاصطناعي.
غالبًا ما تركز المعايير الحالية في هذا الاتجاه على وظائف فردية أو تقييم توليد الإثبات فقط مع تنفيذات مقدمة مسبقًا. ومع ذلك، تبقى مسألة ما إذا كان بإمكان الوكلاء اتخاذ خيارات تنفيذ وإثبات مترابطة عبر كود متعدد الوحدات مفتوحة، مما يتطلب حلًا مبتكرًا.
لملء هذه الفجوة، تم تقديم Vero كأول معيار لتقييم التوليد المشترك للتنفيذ والإثبات على مستوى المستودع. يحتوي Vero على 43 حالة متعددة الوحدات مأخوذة من مستودعات حقيقية تشمل لغات برمجة مثل بايثون (Python)، دافني (Dafny)، فيروس (Verus)، وكوك (Coq)، مما يغطي مجالات متنوعة من بروتوكولات التشفير إلى أنظمة موزعة.
تتكون كل حالة من مستودع Lean 4 متعدد الوحدات مع واجهات برمجة تطبيقات (API) محددة مسبقًا، مما يدعم أوضاع التقييم التي تشمل إثباتات فقط أو تنفيذ مع إثباتات. لتعزيز موثوقية المعيار، يتضمن Vero أيضًا آلية تدقيق تتيح لوكلاء الذكاء الاصطناعي إثبات عدم صوابية المواصفات المقدمة أو عدم صحة الكود المرجعي، مما يساعد على إظهار وتصحيح الأخطاء المخفية أثناء عملية الاختيار.
لقد تم تقييم إعدادات الوكلاء المرتبطة بالتشفير مع إمكانية الوصول إلى أدوات Lean. على الرغم من أن أقوى وكيل يستطع حل 27 من بين 43 حالة، فإنه لم يتمكن من إغلاق أي من المواصفات في أصعب المستودعات. توفر Vero منصة اختبار ملموسة لقياس التقدم نحو توليد البرمجيات المؤكدة على مستوى المستودع، حيث لا تزال الحلول الحالية بعيدة عن المستوى المطلوب.
لزيارة normative ورفع مستوى المعيار، يمكنكم زيارة الرابط.
ما رأيكم في هذا التطور المثير؟ شاركونا في التعليقات!
فيثاغورث الذكاء الاصطناعي: هل تستطيع الوكلاء الذكائيون بناء مستودعات برمجية موسومة رسميًا؟
تم إطلاق Vero، أول معيار لتقييم التوليد المشترك للتنفيذ والإثبات على مستوى المستودع. هذا الاتجاه يعزز الثقة في البرمجيات التي ينتجها الذكاء الاصطناعي من خلال تقديم إثباتات موثوقة للكود الناتج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
