في عالم الذكاء الاصطناعي، تعد التطورات الجديدة بمثابة خطوات كبيرة نحو المستقبل، حيث ابتكرت تقنية جديدة تُعرف بـ Policy Iteration with Human Feedback (PIHF) لتحسين أداء نماذج اللغة. تعتمد هذه التقنية على تطوير هياكل متكررة للتقييم والتحسين، مما يسمح للنموذج بتعديل سلوكه استنادًا إلى التعليمات والعروض.
تقوم PIHF باستخدام نموذج لغة مدرب مسبقًا كأساس للتشغيل، حيث يمكن للنموذج مراجعة سياسات مشكلة بلغة طبيعية. يعمل ناقد نموذج اللغة وخبير طبي على تقييم مسارات استخدام الأدوات وهذا من خلال تتبع الأخطاء المتكررة، مما يؤدي إلى تحسينات قابلة للتحقق.
المثير للاهتمام هو النتائج التي ساهمت فيها PIHF في تحسين Recall@1 بنسبة 32.7 نقطة مئوية لنموذج GPT-5.4، و31.1 نقطة مئوية لنموذج Qwen3.6-35B، مما يدل على نجاح التقنية في تعزيز دقة تشخيص الأمراض النادرة عبر مجموعة من المعايير.
إن استخدام نماذج اللغة كأدوات ثابتة لتطوير السياسات مع توجيه الخبراء يعكس إمكانية تغيير قواعد اللعبة في مجال تشخيص الأمراض، بنقل المعرفة والخبرة من المجال الطبي إلى التكنولوجيا المتقدمة.
ابتكار ثوري: تحسين سياسات الذكاء الاصطناعي من خلال تفاعل الإنسان!
تقدم تقنية Policy Iteration with Human Feedback (PIHF) ثورة في تحسين أداء نماذج اللغة باستخدام تفاعل الخبراء. نتائج جديدة تكشف عن تحسينات ملحوظة في دقة تشخيص الأمراض النادرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
