في عالم تكنولوجيا الذكاء الاصطناعي، يبرز مفهوم جديد يهدف إلى تحسين دقة الكشف عن الأجسام عبر استخدام نماذج اللغة والرؤية (Vision-Language Models أو VLMs). ما يجعل هذا المفهوم مثيرًا هو اعتماده على استراتيجية تُعرف بالتوجيه الناعم (Soft Prompting)؛ حيث يتم استخدام عدد قليل من الرموز المتكررة التي يتم تحسينها في حين تبقى البنية الأساسية للنموذج ثابتة.
استنادًا إلى الأبحاث الحديثة، يظهر أن وضع الرموز في الحدود بين العناصر البصرية والنصية يُعطي نتائج أفضل من غيره، حيث تمت مقارنة النتائج وتحقق تفوق بنسبة 10.0 نقطة على مقياس الدقة (Mean Average Precision أو mAP) مقارنة بمعدل 8.4 نقطة في طرق أخرى.
علاوة على ذلك، تم إثبات كفاءة استخدام الرموز المُعلمة، إذ تبلغ تكلفة التدريب فقط 7,168 معلمة، وهذا يضمن تحقيق دقة مطابقة لأفضل تكوين معتمد على خدمة LoRA. يعد هذا تقدمًا كبيرًا، حيث يمكن لمركز الحفظ أن يظل ثابتًا دون أن يفقد دقة الأداء، على عكس التقنيات السابقة.
ولم يتوقف الأمر عند هذا الحد، فالتوجيه الناعم أثبت فعاليته في مهام أخرى مثل التلاعب في RoboCasa، حيث ساهمت الرموز المتكررة في تحسين الأداء بشكل مُلفت. مما يشير إلى أن هذه النماذج قد تشفر معلومات قيمة للمجالات المتخصصة، وتحديها يكمن في كيفية طرح الأسئلة بشكل صحيح.
تعلم كيف تسأل: أساليب مبتكرة لتكييف نماذج لغة الرؤية بفعالية!
توصل الباحثون إلى تقنية مبتكرة تُعرف بالتوجيه الناعم لتكييف نماذج اللغة والرؤية، مما يُتيح تحقيق دقة استثنائية في الكشف عن الأجسام باستخدام فقط عشرة صور مُعلمة. يُظهر البحث كيف يمكن تحسين الأداء دون الحاجة لتدريب نماذج جديدة بالكامل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
