في العصر الذي تتطور فيه نماذج اللغات الضخمة (Large Language Models) بسرعة، أصبح من الضروري إعادة النظر في كيفية تقييم قدرات هذه النماذج في توليد واجهات الويب. غالبًا ما كانت التقنيات الحالية تتعامل مع توليد الويب كمشكلة تقييم ثابتة، وهذا ما لم يعد كافيًا في ظل التطور السريع للتطبيقات التفاعلية.

تقدم لنا LiveEvalBench، إطار عمل مبتكر يعيد صياغة تقييم توليد الويب كعملية تفاعلية، متعددة الأبعاد، وقابلة للتكيف. يعتمد هذا النظام على نموذج تقييم تفاعلي يشمل مجموعة من الأدوار مثل مهندس البناء (Build Engineer)، مهندس الكود (Code Engineer)، ومختبر واجهة المستخدم (UI Tester). عمل هذه الفرق بشكل تعاوني يجمع الأدلة على مدى الحياة الكاملة لمشروع الواجهة الأمامية، بدءًا من النشر، التفتيش على الكود، وصولًا إلى التفاعل عبر المتصفح.

ما يميز LiveEvalBench هو قدرته على التعامل مع تنوع التنفيذ، حيث يوفر بروتوكولًا تكيفيًا يدمج معايير مشتركة للمقارنة عبر النماذج مع معايير محددة تستند إلى كل عنصر. هذا يقف بجانب القدرة على إضافة أدوار جديدة من المقيمين وأبعاد التقييم من دون الحاجة إلى إعادة تصميم خط الأنابيب.

تظهر التجارب في سيناريوهات توليد ويب متعددة أن LiveEvalBench يتماشى بشكل كبير مع حكم الخبراء البشريين، موفرًا رؤى دقيقة حول قدرات نماذج الجيل على الويب. الكود متاح على GitHub للمطورين الراغبين في استكشاف هذا الإطار الجديد.