في عالم الذكاء الاصطناعي، لطالما اعتمدنا على نماذج اللغات الموجهة (Instruction-Tuned Language Models) لتكون بمثابة proxies لمستجيبي استطلاعات الرأي البشري. لكن دراسة جديدة نشرت على arXiv تكشف عن واقع مثير للقلق: هذه النماذج لا تأخذ عينات من توزيعات آراء حقيقية، بل تقزم إلى إجابة واحدة فقط في معظم الأحيان.
الدراسة تبرز أن نفس الشخصية عند تقديم نفس السؤال تُخرج نفس الإجابة لأكثر من نصف العناصر في معيار آراء الجمهور. هذه الظاهرة، المعروفة باسم "الفشل الحاد"، تعني أن الاحتمالات الداخلية للنموذج تتجمع حول خيار واحد، مما يؤدي إلى ضعف ملحوظ في أداء النماذج المُدربة حسب التعليمات.
تجدر الإشارة إلى أن الفشل لا يحدث فقط في نموذج واحد، فقد تمت مراقبة هذا الاتجاه عبر ثلاثة عائلات من النماذج. بينما تظهر النماذج الأساسية أداءً أفضل بكثير حيث لا تفشل بنفس النسبة.
ما يثير القلق هو أن النموذج نفسه الذي لا يمكنه أخذ عينات من توزيع يمكنه وصفه بدقة خلال اتصال واحد. تُعرف هذه الفجوة باسم "فجوة المعرفة/الفعل (KNOWS/DOES split)".
لذلك، تم اقتراح تقنية جديدة وهي "Prompt-Perturbed Argyle (PPA)"، التي تقلل من هذا الخطأ بنسبة 21% دون زيادة التكلفة. مما يشير إلى آفاق مثيرة للاهتمام لتطبيقات تحتاج إلى مخرجات فردية.
في ضوء هذه النتائج، ماذا تعتقد عن قدرة نماذج الذكاء الاصطناعي على تمثيل الآراء بشكل فعلي؟ هل ترون أن هذه الفجوة يجب أن تدعو إلى إعادة تقييم كيفية استخدامنا لهذه النماذج؟ شاركونا آرائكم في التعليقات!
نماذج اللغات الموجهة: الفشل في العينة بينما تتقن الوصف!
اكتشفنا أن نماذج اللغات الموجهة لا تستطيع أخذ عينات من التوزيعات كما كان يُعتقد. هذه النماذج تتجه نحو إجابة واحدة، ما يعكس فجوة مدهشة بين المعرفة والفعل. تعرّف على تفاصيل هذه الدراسة الجديدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
