في عصر تتسارع فيه تطورات الوكلاء المستخدمين للحواسيب (CUAs) عبر العالم الرقمي، تبرز أهمية التقييم الصحيح لأدائهم. يقوم هذا النوع من الوكلاء بتوثيق الأفعال، والحالات، وأسلوب التفكير. ويعد التأكد من إتمام هذه الوكلاء للتعليمات المعطاة جزءًا مركزيًا في عملية التقييم والرصد التعليمي.

لكن التحدي لا يكمن فقط في وجود الوكلاء، بل أيضًا في كيفية تقييم أدائهم. وعلى الرغم من أن الكتاب والمراجعين البشريين يمكن أن يقدموا بعض المساعدة في التقييم، إلا أن قدرتهم على العمل بشكل واسع تكون محدودة. لذلك، تتجه الأبحاث نحو نماذج رؤية اللغة (VLMs) كقضاة لتقييم مسارات الوكالات.

ولكن هل هذه النماذج قادرة على القيام بذلك بشكل موثوق؟ للإجابة على هذا السؤال، قام الباحثون بتقديم معيار جديد يُدعى OSReward، وهو معيار دقيق وعالي الجودة يقيّم موثوقية قضاة نماذج رؤية اللغة على مسارات الوكلاء. يتم جمع مثل هذه المسارات من أنواع مختلفة من الوكلاء الذين ينفذون تعليمات موثقة بشريًا عبر منصات مختلفة، ويتم تصنيفها بدقة من خلال مراحل متعددة من التقييم البشري.

بالإضافة إلى ذلك، تم تقديم مجموعة تحديات جديدة تُدعى OSReward-Hard، والتي تركز على الحالات الصعبة حقًا، وOSReward-Multi، التي تعمل على تحسين فعالية التقييم ودرجة التنسيق. ومع ذلك، أظهرت الدراسات أن أفضل نماذج VLM حتى الآن لا تحقق المعايير المطلوبة كقضاة موثوقين، حيث تميل إلى التحامل بشكل منهجي، مما يؤدي إلى تصنيف بعض الحالات الفاشلة على أنها ناجحة.

لإغلاق هذه الفجوة، تم إنشاء وإطلاق مجموعة بيانات جديدة تُدعى OS-Shepherd-100K، والتي تحتوي على أحكام مُعلمة بالتفكير لوكلاء الاستخدام. كما تم تدريب نماذج المكافآت المفتوحة OS-Shepherd (9B و35B) على هذه البيانات، مما يمنح إشارات مكافأة موثوقة وبتكاليف منخفضة، مقارنة بالحلول التجارية.

إذا كنت مهتمًا بمزيد من المعلومات حول هذا الموضوع، يمكنكم زيارة رابط [OSReward لمزيد من التفاصيل]. ما رأيكم في مقاربة تقييم نماذج الذكاء الصناعي هذه؟ شاركونا آرائكم في التعليقات.