في عالم الذكاء الاصطناعي المتطور، تُستخدم نماذج اللغات الضخمة (LLMs) كأنظمة تقييم لنصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي. تقوم هذه النماذج بتقديم تقييمات بناءً على افتراض أن الأحكام تشتق من تحليل الاستجابات المقدمة وفقًا لمعايير محددة. لكن دراسة جديدة نشرت على منصة arXiv تشير إلى أن هذا الافتراض يحتاج إلى مراجعة دقيقة.
أظهر الباحثون أن المصنفات المدربة فقط على نصوص المعايير، دون الرجوع إلى أي استجابة تم تقييمها، يمكن أن تحقق أداءً تنبؤيًا كبيرًا في قرارات القضاة. وهذا يشير إلى أن صياغات المعايير وحدها تحمل إشارات تقييمية يمكن استرجاعها، مما يسمح بتوقع النتيجة بشكل جزئي بعيدًا عن مخرجات النماذج.
المزيد من التحليلات، بما في ذلك تحركات فرضية، كشفت أن القضاة غالبًا ما يفشلون في تحديث قراراتهم بشكل موثوق عندما يتم عكس الاستجابة المقدمة أو معيار التقييم. تعكس هذه النتائج القلق بشأن موثوقية تقييم النصوص المعتمد على المعايير، مما يستدعي المزيد من الدراسات المنهجية لفهم واستكشاف آليات التقييم باستخدام نماذج الذكاء الاصطناعي.
هل أنتم مستعدون لمناقشة كيف يمكن تحسين أنظمة تقييم المحتوى المعتمدة على الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.
هل يمكن الاعتماد على نماذج الذكاء الاصطناعي في تقييم النصوص؟ دراسة جديدة تكشف الحقائق
تسليط الضوء على مدى موثوقية نماذج الذكاء الاصطناعي في تقييم النصوص، يكشف البحث الأخير عن وجود قلق حول نظام التقييم القائم على المعايير. يتطلب الأمر مزيدًا من الدراسة لفهم آلية التقييم بشكل أفضل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
