مع ازدهار التجارة الإلكترونية بشكل متسارع، أصبحت العطاءات التلقائية (Auto-Bidding) عنصرًا حيويًا في تحسين أداء الإعلانات في بيئات متعددة للمعلنين. تركز الأساليب الحالية على التعلم المعزز (Reinforcement Learning) والنماذج التوليدية (Generative Models)، لكن لديها قيود تنبع من تقليد سلوكيات تاريخية معقدة تتطلب ضبطًا مكلفًا للمعلمات (Hyperparameter Tuning) مما يزيد من صعوبة تعلم السياسات.

وللتغلب على هذه التحديات، نقدم هنا طريقة جديدة تُسمى QGA، وهي طريقة مبتكرة تمزج بين تقدير قيمة Q (Q-value) ونموذج العطاء التلقائي. تعتمد QGA على إدخال تنظيم لقيمة Q باستخدام استراتيجية التعلم المزدوج (Double Q-Learning) ضمن الهيكل الأساسي لـ Decision Transformer. تسمح هذه التصميمات بتحسين مشترك لتقليد السياسات وتعظيم قيمة العمل، مما يمكّن السياسة المتعلمة في العطاء من الاستفادة من الخبرة المستمدة من مجموعة البيانات وتخفيف الآثار السلبية من المسارات غير المثلى.

علاوة على ذلك، لمعالجة استكشاف المجال السياسي بشكل آمن، نقوم بتقديم آلية استكشاف مزدوج موجهة بقيمة Q. حيث يتم ضبط نموذج Decision Transformer على أهداف متعددة للعودة المستهدفة (Return-To-Go Targets) وأعمال محلية مُحسّنة. حيث يوجه هذا الاستكشاف الديناميكي بواسطة وحدة قيمة Q المذكورة، التي توفر تقييمًا مبنيًا على مبادئ لكل عمل مرشح.

تظهر التجارب على معايير عامة وبيئات محاكاة أن QGA تحقق باستمرار نتائج متفوقة أو تنافسية بشكل كبير مقارنة بالبدائل المتاحة. على وجه الخصوص، في اختبارات A/B واسعة النطاق في العالم الحقيقي، حققت QGA زيادة بنسبة 3.27% في قيمة إجمالي إعلانات الإعلانات (Ad GMV) وتحسينًا بنسبة 2.49% في عائدات الإعلانات (Ad ROI). وبالتالي، تبرهن هذه الطريقة على إمكانياتها القوية في تحويل مجال الإعلانات الرقمية وتحقيق الأداء الأمثل لحملات التسويق.