في عالم متسارع تطورات التقنية، تظهر تقنية جديدة تحمل اسم ComputerSD، وهي طريقة مبتكرة للتعلم الذاتي (Self-Distillation) لوكلاء استخدام الكمبيوتر (CUAs) تعتمد بشكل رئيسي على التغذية الراجعة في الوقت الحقيقي. يهدف هذا التطور إلى تحسين تفاعل الوكلاء مع البيئات التنفيذية القابلة للتنفيذ، مما يتيح لهم التعلم من ملاحظات تفاعلية بدلاً من الاعتماد فقط على مكافآت النتائج المتناثرة التي لا توفر إشرافًا كافيًا على الأفعال الوسيطة.

تعتمد ComputerSD على تقنية التعلم الذاتي المؤسسي (On-Policy Self-Distillation - OPSD) والتي توفر إشارات تعلم على مستوى رموز التوكن، لمساعدة الوكلاء في تحسين أدائهم. ومع ذلك، يقدم التطبيق المباشر لهذه التقنية أثناء تدريب الوكلاء تحديين رئيسيين: التصحيح الثابت قد يصبح غير متماشي مع حالة المتعلم الحالية، والتغيرات المحتملة في احتمالات الإرشادات قد تؤدي إلى تعارض مع دقة المستوى العمليات.

تستجيب ComputerSD لهذه التحديات عن طريق تحويل التغذية الراجعة الفورية، الناتجة عن انتقالات واجهة المستخدم الرسومية (GUI)، إلى إرشادات لتعلم السياسات. يقوم محلل واجهة المستخدم بتحليل الأداء بعد كل إجراء، مما ينتج إشارات قيمة تعمل على تحسين توجيه التعلم.

تظهر النتائج أن ComputerSD تفوقت على الطرق التقليدية، حيث جاءت النتائج على نظام OSWorld-Verified متفوقة بمتوسط نقاط تصل إلى 1.9 و4.1 نقطة مقارنةً بأساليب التدريب الأخرى. هذه الإنجازات تثبت فعالية التعلم من التغذية الراجعة الفورية في تحسين الأداء الوكالي.

في النهاية، توفر ComputerSD نموذجًا واعدًا لرؤية تطورات جديدة في مجال الذكاء الاصطناعي، مما يسهم في تمهيد الطريق لمزيد من الابتكارات والتطبيقات المستقبلية.