في عالم الذكاء الاصطناعي، يعتمد الكثير من التطور على تحسين كيفية تعامل الأنظمة مع الأفعال المختلفة، وخاصة عندما نتحدث عن تقنيات الرؤية واللغة. تم تقديم قيمة جديدة في هذا المجال مع التقنية الرائدة المسماة ValueFormer، والتي تعد بمثابة تحول كبير في كيفية بناء سياسات التعلم الذاتي. قد تواجه سياسات الرؤية واللغة (Vision-Language-Action) التي تعتمد على تقنيات الاستنساخ السلوكي (behavior cloning) مشكلات كبيرة، حيث قد تبدو الحركة وكأنها تسير بشكل جيد حتى عندما تسجل تقدماً غير حقيقي.

لذا، تتضح الحاجة إلى تعزيز هذه السياسات بتقنيات جديدة، وهنا يأتي دور ValueFormer. يعتمد هذا المحول على هيكل (DINOv3) المجمد، ويقدم إشارات ثنائية لكل إطار خلال تمريرة واحدة، حيث يوفر قيمة مونت كارلو (Monte Carlo value) ويمكّن من اكتشاف الأخطاء بشكل فعّال. ولقد أظهرت التجارب على روبوتات حقيقية تعمل في مهام تجميع السندوتشات أن هذه التقنية قد حسنت معدلات الإنجاز من 70% إلى 85%.

إن الابتكار في ValueFormer لا يقتصر على هيكلته فقط، بل أيضاً على كيفية تعريف الأخطاء، حيث يقدم عائدًا ذكيًا يزيد من الاستفادة من نسبة النجاح في كل مهمّة، الأمر الذي يعكس كيف يمكن تطوير خوارزميات الذكاء الاصطناعي لتحسين الأداء الحركي والتفاعلي للروبوتات بشكل كبير. هذه بديل عملي وفعّال للتعلم المعزز (Reinforcement Learning) الذي عادةً ما يحتاج إلى تجارب مكلفة جدًا في العمل الروبوتي.

فهل سنشهد في المستقبل المزيد من الابتكارات مثل ValueFormer تدخل في مجالات جديدة من الذكاء الاصطناعي؟ فلننتظر ونرى ما يحمله المستقبل! ما رأيكم في هذه التطورات التقنية؟ شاركونا في التعليقات.