في عالم الذكاء الاصطناعي، تعتبر طرق الاختيار أثناء الاستنتاج (Inference) مثل أفضل ما في الأسلوب (Best-of-N) إحدى الاستراتيجيات المبتكرة لتحسين عمليات التوليد. حيث تعتمد هذه الطرق على سحب عينة من مجموعة من الإكمالات ومن ثم اختيار الإكمال الأعلى تصنيفًا وفقًا لنموذج مكافآت.
ولتعزيز هذا الإجراء، تأتي فكرة تقطير المخرجات (Distillation) لتحسين هذه العملية في سياسة واحدة، من خلال استبدال المكافآت الخام بالرتب الخاصة بالمجموعة وتعلم سياسة تُرجح الإكمالات ذات التصنيف الأعلى.
ومع ذلك، تُظهر السياسات القائمة على الترتيب تقنيات إعادة وزن سلسة، مما يعني أن المخرجات ذات التصنيف المنخفض تتلقى وزناً أقل لكنها تبقى ضمن الدعم المستهدف. وعلى الرغم من أن إعادة الوزن بشكل أكثر حدة تقلل من تأثير المخرجات ذات التصنيف المنخفض، إلا أنها تزيد من الاعتماد على التصنيف القابل للكسر الذي يتشكل من خلال نموذج مكافأة واحد.
وفي هذا السياق، يبرز نموذج TUP، الذي يمثل سياسة مبتكرة تقوم بإزالة المخرجات ذات التصنيف المنخفض من الدعم، وتعزيز فقط الجزء العلوي من المخرجات بحدّة قابلة للتعديل. حيث يسمح نموذج TUP بتطبيع شكل مغلق، غير مرتبط بتحفيز معين، ويمكن تدريبه بالكامل عبر الانحدار الثنائي، باستخدام معدلات الفوز المحولة كعلامات ناعمة.
نظرًا لبعض الافتراضات النظرية، فإن النموذج يوضح كيف يمكن لمبدأ الوزن المن monotonic أن يتناسب مع قاعدة تقليص الذيل السفلي، مما يوفر دعماً رسمياً لفكرة إزالة الذيل السفلي بدلًا من مجرد تقليل وزنه.
على الجانب التجريبي، يُظهر النموذج TUP تنافسيته مع الخطوط الأساسية القوية للتوافق الخارجي.
هل تعتقد أن هذه التقنيات يمكن أن تُحدث ثورة في مجال الذكاء الاصطناعي؟ نحن متشوقون لمعرفة آرائكم في التعليقات!
نموذج ثوري لتحسين توليد المحتوى: إزالة الأسوأ وترجيح الأفضل!
تم تقديم نموذج TUP الجديد الذي يركز على تحسين جودة التوليد من خلال إزالة المخرجات ذات الترتيب المنخفض. يقدم هذا النموذج حلاً مبتكرًا لتحسين النتائج عبر إعادة تصنيف المخرجات الأعلى فقط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
