في عالم الذكاء الاصطناعي، تمثل تقنيات التقطير (Distillation) إحدى الأدوات الثورية التي تسهم في تحسين أداء النماذج من خلال الاستفادة من تغذية راجعة متعددة. في هذا الإطار، نميز بين أسلوبين من التقطير: التعلم المباشر (On-policy Distillation) والتعلم غير المباشر (Off-policy Distillation).

يتمثل التعلم المباشر في تلقي النماذج للملاحظات من معلمين على ردودها الخاصة، مما يُظهر وعودًا في تقليل ظاهرة النسيان مقارنةً بأسلوب الضبط الإشرافي (Supervised Fine-Tuning). ومع ذلك، لا تزال الفوائد والمخاطر المرتبطة به غير مفهومة بشكل كامل. عبر دراسة التقطير التسلسلي من معلمين متعددين، يمكن للطالب تقليل تباينه المتوسط مع المعلمين. هنا، توجد طريقتان رئيسيتان لتقليل التباين:

1. **التقليل الأمامي لـ Kullback–Leibler (KL)**: يُنتج مزيجًا رياضيًا وزنيًا.
2. **التقليل العكسي لـ KL**: يُنتج تجميعًا هندسيًا وزنيًا مُنظمًا.

تشير النتائج إلى أن الأساليب التي تعتمد على التغذية الراجعة المباشرة وغير المباشرة يمكن أن تتعلم هذه الأهداف، حيث نبحث في حدود الخطأ اللوغاريتمي ضمن الإعدادات الجدولية ونوسع التحليل ليشمل تقريب الوظائف.

عند تحليل أهداف التكتيل، نكتشف آليات تساعد في تفسير فوائد وضعف أسلوب التعلم المباشر. بالمقارنة مع التقليل الأمامي، يُظهر التقليل العكسي أداءً أفضل في الاحتفاظ بتفضيلات خبراء واثقين أمام تغذية راجعة غير معلوماتية، لكنه يكون أكثر حساسية للمعلمين الذين يمنحون احتمالات منخفضة جدًا للاستجابات الصحيحة. كما تكشف الشروط على مستوى الرموز عن اعتمادها على توزيعات الاستمرارية التي قد تفضل المقدمات غير الصحيحة على المدى الطويل.

تسلط هذه النتائج الضوء على الحاجة إلى فهم أعمق لتقنيات التقطير والتحديات المرتبطة بها، مما يمهد الطريق لتطوير أساليب أكثر فعالية للتعلم في المستقبل.