تزداد استخدامات نماذج اللغات الضخمة (Large Language Models) في مختلف المجالات، بما في ذلك اختبارات الفرضيات، حيث تقوم هذه النماذج بدور القضاة بتقييم المخرجات، ووضع العلامات على البيانات، وتحديد ما إذا كانت الأنظمة تلبي المعايير المطلوبة للجودة. لكن، يجب أن ندرك أن استخدام أحكام الذكاء الاصطناعي في الاستنتاج الإحصائي الرسمي يتطلب نهجاً مختلفاً تمامًا عن مجرد اعتبارها مؤشرات صحيحة.
تتسم أحكام الذكاء الاصطناعي بالتحيز أو الضوضاء، مما يتطلب اختبار فرضيات دقيق يستلزم التحكم في أخطاء النوع الأول والنوع الثاني. لذلك، تم دراسة كيفية دمج أحكام الذكاء الاصطناعي مع التحقق الانتقائي من البشر لإجراء اختبار فرضيات موثوق بأقل تكلفة ممكنة.
تتناول الدراسة مجموعة من العناصر ذات العلامات الثنائية الخفية، بعد اختيار مجموعة محددة من العناصر، يمكن لصانع القرار أن يستفسر بشكل انتقائي عن الذكاء الاصطناعي، أو يرسل عنصراً مباشرة إلى إنسان، أو يتطلب من البشر التحقق من العناصر التي قيمها الذكاء الاصطناعي بعد وقوعها.
تم تطوير سياسة SCALE، وهي سياسة اقتصادية تعتمد على تقدير الذكاء الاصطناعي وتسلسل التصعيد البشري المتكيف. توفر SCALE نتائج دقيقة حتى مع أحجام العينة المحدودة، وتحقق نتائج قريبة من الحدود الأدنى للتكاليف المتوقعة، خاصة عندما تفوق أحكام الذكاء الاصطناعي منخفضة التكلفة مع التحقق المت-selective من البشر. يُظهر البحث أن هناك فرصًا كبيرة للتوفير عندما تساهم كلاً من آراء الذكاء الاصطناعي والتحقق البشري في تحقيق نتائج دقيقة.
تفتح هذه الدراسة آفاقًا جديدة لكيفية التكامل بين الذكاء الاصطناعي والبشر في مجال الأبحاث والاستنتاج، مما يدعو الخبراء والباحثين إلى النظر في استخدام هذه الطرق المعقدة لتحقيق الكفاءة والدقة.
اختبار الفرضيات المدعوم بالذكاء الاصطناعي: سياسة اقتصادية مبتكرة لتقليل التكاليف
تقدم الدراسة الجديدة طريقة مبتكرة لاستخدام الذكاء الاصطناعي في اختبارات الفرضيات، حيث تجمع بين تقييمات الذكاء الاصطناعي والتحقق الانتقائي من البشر لضمان دقة التقييمات بأقل تكلفة ممكنة. نموذج SCALE الجديد يحقق نتائج مثيرة في تقليل الأخطاء وتحسين الكفاءة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
