ConsistencyAI؟">ما هو ConsistencyAI؟
تتمثل فكرة ConsistencyAI في اختبار ما إذا كانت نماذج اللغات الضخمة تقدم حقائق متناقضة عند الإجابة على نفس الأسئلة من قبل مستخدمين مختلفين. والجدير بالذكر أن هذا المعيار تم تطويره بشكل مستقل، دون تدخل من أي موفري نماذج، مما يوفر تقييمًا موضوعيًا ويضيف عنصر accountability (المسؤولية).
منهجية البحث">منهجية البحث
اجتاز فريق البحث 19 نموذجًا للغة من خلال استفسارات طلبت 5 حقائق لكل من 15 موضوعًا مختلفًا. وقد تم تكرار هذه الاستفسارات 100 مرة مع إضافة سياق مختلف من ديمغرافيا متعددة، أخذًا في الاعتبار شخصيات تمثل السكان بشكل عام. وبعد معالجة الإجابات وتحليلها، تم حساب درجة الاتساق باستخدام قياسات cosine similarity.
النتائج">النتائج
أظهرت التجارب نتائج مثيرة؛ حيث تراوحت درجات الاتساق من 0.9065 إلى 0.7896، مع متوسط بلغ 0.8656. وهذا المتوسط تم اعتباره كحد مرجعي للاتساق. ومن بين النماذج المشاركة، كان نموذج Grok-3 من xAI الأكثر اتساقًا، في حين سجلت بعض النماذج الأخف تقييمات أقل.
تأثير المواضيع والمزودين">تأثير المواضيع والمزودين
ثمة فرق واضح في الاتساق حسب الموضوع: كانت سوق العمل هي الأقل اتساقًا، في حين احتلت القضايا المتعلقة بقادة مجموعة السبع (G7) مرتبة عالية من الاتساق. كما لوحظت تباينات في قضايا مثل اللقاحات والصراع الإسرائيلي الفلسطيني بحسب مزود النموذج. هذه النتائج تؤكد أن كلاً من المزود وموضوع السؤال يساهمان بشكل حاسم في تحديد دقة المعلومات.
ماذا بعد؟
المؤكد أن هذا الابتكار يمثل خطوة هامة نحو تعزيز الشفافية والمساءلة في الذكاء الاصطناعي. كما تم إتاحة رمز البرنامج والعرض التفاعلي لدعم التقييم القابل للتكرار وتشجيع استراتيجيات الاستفسار المستقلة عن الشخصية.
**ما رأيكم في هذا التطور؟ شاركونا في التعليقات!**
