في حديث عن أقصى حدود تحليل نماذج اللغة، تكشف دراسة حديثة عن نتائج تعتبر مثيرة للاهتمام. حيث تمت دعوة نموذج للغة بحجم 0.6 مليار معلمة لفحص 1200 استنتاج منطقي، متضمنة نصفها صادقة والنصف الآخر مشوه بتعديل دلالي واحد. النتيجة؟ النموذج كان يجيب بـ "نعم" في جميع الحالات، مما يدل على غياب التمييز.
خلال فحص سلوك النموذج، لم يستطع التفريق بين الإجابات الصحيحة والخاطئة، لكن أدوات التحليل الداخلية، المسماة بيمين "البروبس" (probes) على حالاته الخفية، تمكنت من تحقيق دقة تصل إلى 0.96 في قياس الأجزاء المجردة. ولكن أين حدث الخطأ في الحكم؟
عندما قُمنا بدراسة أعماق النموذج، استنتجنا أن الفشل الأكبر ينجم عن عدم ضبط معيار واحد، والذي يؤدي إلى تجريد حكم النموذج. بينما تبين أن اتخاذ القرار يعتمد على عتبة مشبعة، تزيد بمقدار +4.6 سيغما، مما يتسبب في القضاء على الدقة. والمثير للاهتمام أن تلك النتائج ليست فريدة؛ فقد تم رصد نفس النمط عبر مجموعة من التكوينات اللغوية المختلفة.
بالإضافة إلى ذلك، تبين أن سلوك النموذج المجاني يتجه نحو اللامونوتوني، مما يعني أن نموذجًا بحجم 8 مليارات قد يحقق نتائج أدنى من نموذج 4 مليارات، لكن ذلك لم يكن نتيجة الفشل في العتبة، بل كانت من خلال قنوات الرد الخاطئة.
ومع ذلك، الخبر الجيد هو أن التعديل البسيط على معلمة واحدة يمكن أن يُصلح هذا الخلل، مما يعزز دقة النموذج من 50% إلى 81%، حيث استطاع التصحيح التفاعلي استعادة 94% من الدقة لدى النموذج الأكبر. تم استخدام استدلالات نادرة (few-shot prompting) بنفس الطريقة لتعديل العتبة، مما يحافظ على تدرجات الدقة.
تفاصيل إضافية أظهرت أن مقارنة نتائج الاستقصاء (probe) أو العتبة تُميز بين ثلاث مناطق: المخفية، غير المضبوطة، وغير المكتشفة. بينما أكد الاختبار المطبق على مهمة متاهة أن التدقيق كان دقيقًا في تحديد النسخة الثالثة. في النهاية، تُظهر النتائج أن نماذج اللغة، رغم قوتها، تحتاج إلى توجيه دقيق لتحقق الأداء الأمثل.
تواجه نماذج اللغة تحديات مستمرة، ويبدو أن استكشاف هذه الحدود سيظل موضوعًا مثيرًا للبحث والنقاش بين مطوري الذكاء الاصطناعي. ما رأيكم في تأثير مثل هذه التعديلات على أداء نماذج الذكاء الاصطناعي؟ شاركونا في التعليقات.
عندما تتفوق الاستقصاءات الداخلية على قراءة الإجابة: اكتشاف المعرفة المخفية في نماذج اللغة
أظهرت دراسة جديدة أن نماذج اللغة الكبيرة قد تفشل في تمييز الاستنتاجات المنطقية بسبب أخطاء في العتبات، مما يؤدي إلى نتيجة غير دقيقة. لكن يمكن إصلاح هذه المشكلات بطرق بسيطة للتعديل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
