في خطوة جديدة نحو التقدم في عالم الذكاء الاصطناعي، أُعلنت شركة Liquid AI عن إطلاق نموذجها الجديد LFM2.5-VL-3B، وهو نموذج متقدم للرؤية واللغة (vision-language model) يعتمد على 3.1 مليار من المعلمات. يهدف هذا النموذج إلى تعزيز تجربة المستخدم مع تطبيقات الذكاء الاصطناعي عن طريق استخدام قدراته المتقدمة في قراءة الشاشات والتفاعل مع العناصر والأدوات.

يتميز نموذج LFM2.5-VL-3B بتحقيق معدل متوسط قدره 80.7 على اختبار ScreenSpot-v2، مما يدل على كفاءته في معالجة البيانات البصرية النصية. كما أنه سجل تحسينًا ملحوظًا في قدرة توجيه الأشياء (grounding objects) في مجموعة بيانات RefCOCO، حيث ارتفع من 57.1 إلى 87.9.

ما يجعله فريدًا هو دعم خاصية استدعاء الأدوات (function calling) التي تم إدخالها حديثًا في خط نماذج VL، حيث تمكن ToolSandbox من الانتقال من 26.4 إلى 59.5، مما يعني وجود تحسين كبير في أداء النموذج.

فضلاً عن ذلك، يتناسب النموذج الجديد مع حجم يبلغ تقريبًا 3 جيجابايت، ويحقق سرعة فك رموز تصل إلى 228 توكن/ثانية على جهاز Apple M5 Max. هذا يفتح أفقًا جديدًا للإبداع في استخدامات الذكاء الاصطناعي وتطبيقاته المتعددة.

لم يكن إطلاق هذا النموذج مجرد تحديث، بل هو خطوة جريئة نحو تعزيز القدرة التفاعلية للأنظمة الذكية. ما رأيكم في هذه الابتكارات؟ هل تعتقدون أنها ستغير من شكل التطبيقات الذكية في المستقبل؟ شاركونا في التعليقات!