في عالم يتسم بالتنوع الغذائي، تأتي الابتكارات التكنولوجية لتساعدنا في فهم وعرف الأطباق بطريقة أكثر فعالية. يقدم الباحثون نموذج أوليف جيمّا (OliveGemma)، الذي يُعتبر نموذج لغة بصري (Visual Language Model) يقدم حلاً مبتكراً لتحديات التعرف على الأطعمة الأوروبية والمتوسطية. يعتمد النموذج على بنية PaliGemma-2-3B المفتوحة، وتم تدريبه بدقة على مجموعة بيانات تضم 17,340 صورة مأخوذة من ثلاثة مشروعات بحثية أوروبية هي: MedGR وODIN وVIPPSTAR.

يُعتبر التعرف الدقيق على الأطباق تحدياً بسبب تباين الأطعمة داخل الفئة الواحدة، حيث طوّر الباحثون هذا النموذج ليشمل 216 فئة من الأطباق و102,642 عنصر من أسئلة وإجابات تعزز فهم المستخدمين للأطعمة.

تحت نظام التحقق المتقاطع، أظهر أوليف جيمّا دقة تصل إلى 92.96%، متفوقًا على النماذج التقليدية مثل DenseNet-121 بنسبة 7.31%. كما حقق أداءً متميزاً في معدلات دقة Top-3 وTop-5، حيث حصد المرتبة الثانية وسط النماذج التنافسية. يثبت أوليف جيمّا أن التكيف مع النماذج الأصغر يمكن أن يحقق نتائج تفوق النماذج الأكبر، مساهماً في تقدم تقنيات الذكاء الاصطناعي المبنية على الرؤية.

إذا كنت مهتمًا بالاستزادة حول هذا الابتكار الرائد، يمكن الاطلاع على النموذج عبر هنا ومتابعة النتائج والتجارب على هذا الرابط.