يعتبر نموذج الانتشار الاحتمالي القابل للإزالة (Denoising Diffusion Probabilistic Models - DDPMs) من الأدوات المتطورة في مجال الذكاء الاصطناعي، حيث يعتمد على بدء توليد العينات من الضوضاء ثم إزالة الضوضاء تدريجياً مع الحفاظ على كل تحديث قريباً من الحالة الضبابية الحالية. ورغم فعالية هذا النموذج في العديد من المجالات المستمرة، إلا أن دوره في المهام المنفصلة العالمية، مثل سودوكو، الاتصال البياني، المربعات اللاتينية، ولعبة الملكات، يبدو أقل وضوحاً.

أحد التحديات الأساسية لهذه المهام هو أن الأخطاء المبكرة قد تكون صعبة الإصلاح. لهذا السبب، قد يحفظ نموذج الانتشار القياسي الأخطاء في المراحل الأولى، حتى عندما تكون التوقعات النظيفة للنموذج مفيدة.

مقارنةً بالعينات القياسية، فإن أخذ العينات مباشرة من توقعات النموذج النظيفة يحقق نتائج مبهرة. فبدون إعادة التدريب، يزداد معدل صلاحية سودوكو من 31% إلى 95% مع تحقيق مكاسب مثمرة في المهام المنفصلة الأخرى. وهذه النتائج تدعم فرضيتنا أن البقاء قريباً من الحالة الضبابية الحالية قد يكون مضرًا، خاصةً إذا انحرف المسار العكسي بعيداً عن توزيع الضوضاء الأمامي الذي تم تدريب النموذج عليه.

ولمعالجة هذه الظاهرة، قمنا بإدخال تدريب التصحيح الذاتي، الذي يعرض النموذج لتوقعاته الخاصة، مما يعزز مقاومته للأخطاء التي قد تنشأ أثناء عملية الاستدلال. وتظهر النتائج أن نماذج الانتشار المستمرة يمكن أن تتعلم القيود العالمية المعقدة، ولكن مهام التفكير المنفصل تحتاج إلى توافق أفضل بين التدريب والاستدلال. يمكن تحقيق ذلك من خلال اعتياد عينات تقلل من الالتزام بالقرارات المبكرة، أو عبر تدريب النموذج على تصحيح أخطائه أثناء الاستدلال. إن التحسينات التي شهدناها تشعرنا بالتفاؤل بشأن مستقبل هذه التقنيات في تحقيق تقدم كبير في المهام المنفصلة.