في عالم الذكاء الاصطناعي المتسارع، تتزايد الحاجة إلى نماذج قادرة على معالجة البيانات من أنواع متعددة، مثل النصوص والصور، بطريقة فعالة وبدون أي تعقيدات إضافية. هنا يأتي دور نموذج NeoMME، الذي يعد ابتكاراً في معالجة البيانات متعددة اللغات والأنماط.
تم تقديم NeoMME كعائلة من المعالجات متعددة اللغات، مع مجموعتين من المعلمات 260 مليون و800 مليون، حيث تعمل على معالجة النصوص المختلفة وقطع الصور الخام من خلال مشفر ترينسفورمر (Transformer) ثنائي الاتجاه. جميع النماذج تم تدريبها من الصفر باستخدام تقنية جديدة قائمة على هدف النص المنقطع باستخدام التشتت، بالتوازي مع أجزاء مرئية من الصور للحصول على أمثلة متعددة الأنماط.
ما يجعل NeoMME متميزاً هو دعمه لسياقات تصل إلى 16,384 رمزاً، مما يمكنه من تشفير صفحتين من الصور بدقة 4K UHD. ولإثبات قدراته، تم التعديل الدقيق على NeoMME باستخدام رؤوس مترابطة وكثيفة. في معيار ViDoRe v3، حقق NeoMME-Retriever 260M أداءً أعلى من جميع النماذج التي يتم تقييمها، بينما سجل النموذج الأكبر NeoMME-Retriever 800M نتائج استثنائية.
إحدى الابتكارات المثيرة في التصميم هي تقنيات تجميع الرموز الهرمية والتكميم غير المتناظر، التي تسهم في ضغط التمثيلات المدمجة متعددة الأنماط بمعدل 255 ضعفاً مع الحفاظ على أكثر من 95% من نتائج النماذج الأساسية.
تم تقديم NeoMME الآن إلى مجتمع مطوري الذكاء الاصطناعي من خلال Hugging Face Transformers، حيث يمكن للمستخدمين الوصول إلى الهيكل المدرب مسبقاً ونقاط التوقف المتوافقة مع الاسترجاع بموجب ترخيص Apache 2.0. هذا التطور يشير إلى خطوة كبيرة نحو تقديم حلول فعالة وعالية الأداء في بيئات معالجة البيانات متعددة الأنماط.
هل تتطلع لتطبيقات عملية لهذا النوع من النماذج؟ ما رأيكم في نتائج NeoMME مقارنة بنماذج أخرى في السوق؟ شاركونا في التعليقات!
استعد لاكتشاف NeoMME: النموذج الثوري في معالجة اللغات المتعددة والصور!
تقدم NeoMME تقنية جديدة في معالجة البيانات متعددة الأنماط واللغات، مما يجعلها الخيار الأمثل للتعديل الدقيق والكفاءة العالية. بفضل تصميمها الفريد، تُظهر هذه التقنية أداءً متفوقاً مقارنة بالعديد من النماذج الأخرى.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
