في عالم الذكاء الاصطناعي، يعتمد العديد من الباحثين على استراتيجيات البحث التطوري المدفوعة بواسطة نماذج اللغات الضخمة (LLMs)، حيث يتم إنشاء برامج جديدة عبر إطلاق بذور (seeds) وتكرار كل واحدة منها. في هذا الإطار، تمثل إحدى القضايا الحاسمة كيفية تقييم هذه الاستراتيجيات بشكل مناسب.
عادة ما يقوم الباحثون بتقرير نتائجهم بناءً على إعداد ميزانية واحدة، مع إجراء اختبار لبذور واحدة فقط لعدد ثابت من التكرارات، مما يجعل هذا النهج ليس كافياً للحصول على صورة كاملة عن الأداء. لذا، تم تنفيذ دراسة جديدة حيث تم تقييم ثلاث استراتيجيات بحث تطوري على خمس مهام تحسين شائعة.
اكتشفنا أن الطريقة المثلى لتوزيع ميزانية ثابتة بين بذور أكثر (عرض) وتكرارات إضافية (عمق) تتغير تبعاً للاستراتيجية والمهام والميزانية الإجمالية. على سبيل المثال، في إحدى المهام، كانت الاستراتيجية التي بدت الأضعف عند استخدام بذور واحدة هي الأفضل عند استخدام أربعين بذور، بينما في مهمة أخرى، كان العدد الأمثل للتكرارات أدنى بكثير من القيمة الشائعة في الممارسات، مما يعني أن إضاعة عمق إضافي يمكن أن تتسبب في هدر الميزانية.
لتوفير توجيه أفضل في هذه المجالات، قمنا بتطوير بروتوكول قياسي يقيم الحدود بين البذور والتكرارات ويوفر إرشادات عملية للاستخدام. تسلط هذه النتائج الضوء على أهمية الفهم الكامل لاستراتيجية البحث التطوري وأثرها على النتائج النهائية، مما يساعد الباحثين والممارسين في اتخاذ قرارات أفضل في المستقبل.
تحول أو وهم؟ إعادة تفكير في تقييم البحث التطوري لنماذج اللغات الضخمة 📈
تبحث الدراسة في استراتيجيات البحث التطوري المدفوعة بواسطة نماذج اللغات الضخمة وتكشف عن تأثير توزيع الميزانية على فعالية النتائج. النتائج تقدم إرشادات عملية لتحسين الأداء في المهام التحسينية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
