في عالم الذكاء الاصطناعي المتقدم، تبرز تقنية التصميم التلقائي للخوارزميات (AHD) كأداة فعالة تعتمد على النماذج اللغوية الكبيرة (LLM) لتمكين الباحثين والمطورين من ابتكار خوارزميات متطورة. ترتكز هذه التقنية على عملية تكرارية تتضمن اقتراح الخوارزميات وصقلها، حيث تتم مراعاة الأسباب التصميمية مقابل الأكواد القابلة للتنفيذ.

تعتمد أنظمة AHD التقليدية على تثبيت مولد الخوارزميات، لكن التقنيات الجديدة مثل EvoTune ونموذج Co-Evolution of Algorithms and Language Model (CALM) تقوم بتحديث المولد استنادًا إلى المرشحات التي تم تقييمها. عندما تدفع النتائج المدفوعة بتعلم التعزيز مع مكافآت قابلة للتحقق (RLVR)، يتم إنشاء حلقة مرتبطة بالبحث، حيث يمد مجرى المرشحات التي تم تقييمها كلاً من تحديثات حالة البحث وإشارات التدريب للنموذج المنتج لمرشحات مستقبلية.

ومع ذلك، لا تحدد صلاحية الأداء الفعلي وحدها التحديثات المفيدة للنموذج؛ يجب أن تأخذ عملية التحويل إلى إشارات تعلم بعين الاعتبار السياق الذي أنتج كل مرشح. لذلك، نقوم بصياغة عملية التدريب بعد الإطلاق على النماذج اللغوية الصغيرة المفتوحة في AHD كعملية بناء إشارات تعتمد على السياق، وتطوير خراائط بديلة تربط بين صلاحية البرنامج، أداء المهام، وسياق الجيل إلى إشارات التحديث.

من خلال استخدام تخفيضات مشتركة تم تقييمها وميزانيات تحديث متطابقة، تم تنفيذ تجارب مسيطرة عبر مهام AHD وأسر عائلية من النماذج لمقارنة هذه الخرائط مع معايير تدريب ما بعد الإطلاق، بهدف اختبار تأثيرها على الصلاحية، الأداء بين الاقتراحات الصالحة، والعائد من الاقتراحات الصالحة التي تتحسن من خلال المقارنات السياقية.

تقوم تقييمات نقاط التحقق التكميلية، البحث الثابت، وتقييمات النظام الحي ببحث في ما إذا كانت المكاسب على مستوى الاقتراح تضهر في سلوك نقاط التحقق المحدّثة أو البحث اللاحق، بدلاً من أن تنبع فقط من تراكم حالة البحث. كما يتم إجراء مقارنة ملائمة للموارد تحت محاسبة التكاليف المحددة مسبقًا لاختبار ما إذا كان التحديث عبر الإنترنت يضيف قيمة تتجاوز البحث الإضافي مع مولد ثابت.

بهذه الطريقة، تتجنب هذه التصميمات اعتبار المكاسب من البحث الشامل دليلاً على قدرات تصميم خوارزميات أقوى.