تعتبر المهام الطويلة الأمد من بين التحديات الأكثر صعوبة التي تواجه نماذج اللغات الضخمة (LLMs)، والسبب يعود إلى أن كل خطوة تعتمد على سابقتها. في ظل هذه الظروف، يمكن أن تتدهور دقة كل خطوة بشكل كارثي نتيجة للأخطاء المتسلسلة، مما يؤدي إلى زيادة حادة في احتمالية فشل النتيجة النهائية مع زيادة طول المهمة.
تظهر النماذج الحالية نتائج نجاح شاملة لكنها تعاني من خلط مفهوم تتبع الحالة مع تفسير التعليمات، مما يعيق فهم المشاكل الأساسية. في هذا السياق، يوفر هذا البحث تجربة متعمقة لاختبار قدرة نموذج على حساب دالة تجزئة MD5 خطوة بخطوة، عبر سلسلة من 196 مكالمة أداة معتمدة موزعة على 64 جولة. يهدف هذا الأسلوب إلى تقييم فعالية تتبع حالة النموذج.
في هذه الدراسة، استخدم نموذج gpt-oss-120b، الذي يحتوي على حوالي 5.5 مليار معلمة نشطة، وتمكن من تتبع الحالة الصحيحة عبر جميع المكالمات وتوفير التجزئة الصحيحة في الغالبية العظمى من الحالات. عند زيادة تعقيد المهمة، تم استبدال كل أداة بأداة ثانوية تعتمد أيضاً على نموذج LLM آخر، مما يشير إلى قدرة النماذج على التعاون وإدراك الأخطاء بدلاً من العيش في دوائر مغلقة.
تسلط هذه التجربة الضوء على أهمية الحفاظ على السياق الخاص بالنموذج خلال كل عملية، وكذلك الحاجة إلى تصويت الذكاء في الأداة العاملة لإزالة الزلات المحتملة في العمليات الحسابية. يتم تحليل نقاط الفشل المتبقية بدقة، مع فرزها من حيث الأصل لتحديد مشاكل تتبع الحالة بشكل منفصل عن الأخطاء الحسابية.
هذه النتائج تفتح آفاقاً جديدة لتطوير نماذج LLM التي يمكنها التعامل بكفاءة مع المهام الطويلة الأمد، مما يساهم في تحسين استراتيجيات التقييم المستقبلية ويعزز من استخدام الذكاء الاصطناعي في تطبيقات معقدة.
تتبع الحالة على المدى الطويل في نماذج اللغات الضخمة: تنفيذ MD5 عبر سلسلة معقدة من المكالمات الأداة
يتناول هذا البحث تحديات المهام الطويلة الأمد في تقييم نماذج اللغات الضخمة (LLMs) وكيف يمكن لهذه النماذج حساب القيمة التشفيرية MD5 بدقة عالية. يتم اختبار قدرة النموذج على تتبع الحالة الوسطى بشكل منهجي، مع التركيز على إحباط الأخطاء على طول الطريق.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
