تعتبر القرارات المثلى في البيئات الديناميكية المتغيرة تحدياً كبيراً. وفي هذا السياق، تم إدخال تقنية جديدة تسمى تحويل الهدف الموجه (Target-Aligned Fusion - TAF) والتي تتيح تحسين التعلم من التسلسلات القرارية باستخدام بيانات خارجية بالرغم من تغير الديناميكيات.

تساعد هذه التقنية في دمج مسارات خارجية مع بيانات مستهدفة لتحقيق التوافق بين البيانات. ووفقاً للدراسة، ارتكزت الطريقة على تقييم المخاطر باستخدام معيار Bellman المتعلق بالبيئة المستهدفة. كما تم قياس ذلك من خلال كميتين قابلتين للقياس:
- **Delta_m**: التنسيق بين هيكل الحالة للمقاطع المحتفظ بها.
- **Delta_w**: تكلفة النقل الموزونة من التحولات الخارجية إلى البيئات المستهدفة.

تقوم التقنية على قواعد معينة: المقاطع الخارجية يتم تصفيتها أولاً بناءً على توافق هيكل الحالة، ثم إعادة وزن التحولات بناءً على توافقها مع الهدف.

تم تجسيد هذه المعايير في نموذج TAF-DT، الذي يستخدم تقنيات مثل الانحدار الأقصى المتوسطي (Maximum Mean Discrepancy - MMD) لتحديد المقاطع المناسبة، والنقل الأمثل لضمان الوزن المناسب.

لقد أظهرت التجارب على مهام التحكم المختلفة أن TAF-DT حققت أداءً قوياً وتفوق على أساليب التعلم المعتمد على التسلسل القوي والأنماط التقليدية، مما يجعلها تفتح آفاق جديدة لتطبيقات الذكاء الاصطناعي في فهم القرارات في البيئات الديناميكية.