في عالم الذكاء الاصطناعي، تعد نماذج اللغة الضخمة (Large Language Models) من الأدوات الأكثر تطورًا، لكن كيفية تصميم التعليمات لها لا تزال موضوعًا للبحث والتحليل. قد يقرر الممارسون كيفية صياغة التعليمات بشكل مباشر، لكن ماذا عن الأدلة العلمية التي تدعم خياراتهم؟

أعلنت دراسة جديدة عن نتائج تجربتين منظمتين تهدفان إلى فهم تأثير تنسيق التعليمات (markdown، نص بسيط، نثر، أو جدول) وعدد التعليمات في التعليمات واستخدام السياق.

تتضمن التجربة الأولى اختبار مدى انحدار الالتزام في الاستجابة مع زيادة عدد التعليمات من 10 إلى 160، حيث أظهرت النتائج انهيارًا استجابةً على الإطلاق عند الوصول إلى 80 تعليمات في جميع النماذج المدروسة، وخاصة عند استخدام تنسيقات معينة.

أما التجربة الثانية فتناولت دقة الاسترجاع وصحة المعلومات عبر مجموعة متنوعة من السياقات، مما أظهر أن النماذج تحافظ على دقة عالية مع سياقات تصل إلى 128،000 رمز، ثم تبدأ بالانخفاض بشكل حاد.

تمكن المحللون من قياس عدة عوامل بما في ذلك تكرار تزييف المعلومات، ولكنهم لم يجدوا أي حالة من الحالات، مما يعد مؤشرًا إيجابيًا على دقة النماذج.

ضاعفت الدراسة من أهمية التجريب المنظم في تطوير النماذج الذكية. يمكنكم الاطلاع على مجموعة البيانات والنماذج المستخدمة من خلال زيارة VeyraBench لتحميل النتائج الكاملة وتجربتها بأنفسكم!