في عالم الذكاء الاصطناعي التوليدي (GenAI)، تُعتبر التدقيقات (audits) أداة أساسية لضمان الالتزام بالسياسات المعمول بها. لكن كيف يمكننا التأكد من أن النتائج التي نحصل عليها دقيقة وتعكس فعلاً سلوك الأنظمة؟ هذا هو التساؤل الذي يطرحه فريق البحث الذي قدم لنا أداة جديدة تُدعى ASSERT.

تعمل ASSERT كخط أنابيب قياس (measurement pipeline) مستند إلى المواصفات، حيث يمكنها ربط كل درجة موثقة من الأداء بتعليمات مكتوبة تُستخدم في قياس تلك الدرجة. هذا الربط ليس مجرد تحسن شكلي، بل يعزز الشفافية ويجعل من السهل تتبع الاختلافات بين التدقيقات على أنظمة GenAI مختلفة.

في دراسة حالة مُثيرة تتعلق بالخداع في الحوارات، وجد الباحثون أن نتائج التدقيق (reported rates) تتغير بشكل ملحوظ اعتمادًا على إعداد الحوار، المستخدم المحاكي، القاضي، والمعايير التي تم قياس عدم الامتثال على أساسها. هذا يعني أن الاختيار غير الدقيق للمعايير يمكن أن يغير النتائج بشكل كبير ويؤثر على ترتيب الأنظمة فيما يتعلق بجودتها وأدائها.

إن استخدام ASSERT يعد تقدمًا كبيرًا نحو تحسين دقة التدقيق ورفع مستوى الموثوقية في تقنيات الذكاء الاصطناعي، معتبرًا في الوقت ذاته أهمية فهم الاختلافات في النتائج بشكل أعمق. إذا كنت مهتمًا بالذكاء الاصطناعي، فإن ASSERT تمثل خطوة للأمام نحو تقييم أفضل وأكثر دقة لتلك الأنظمة. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.