في عالم علوم النباتات، تُعد القدرة على التعرف التلقائي على صفات النباتات من صور الهيرباريا (Herbarium Images) أمرًا جوهريًا. ومع ذلك، فإن التحديات التي تطرأ من العناصر الخلفية مثل التسميات النصية والمواد المركبة تُعيق النماذج التقليدية، مما يؤدي إلى التعلم الخاطئ وعدم الاعتماد على بنية النباتات الصحيحة. لتنفيذ هذا التحدي، قدم الباحثون نموذج AT-ViT، الذي يمثل ثورة في هذا المجال.

يعمل نموذج AT-ViT، الذي يعتمد على هيكل Vision Transformer، بنظام ثنائي الفروع حيث يجمع بين صور الهيرباريا الأصلية ونسخها المقطعّة بشكل ذكي باستخدام تقنية الانتباه المتقاطع (Cross-Attention) متعددة المستويات. ما يميز AT-ViT هو آلية وزن المقاطع المستندة إلى القناع، التي تعزز المناطق المتعلقة بالنباتات وتقلل من التأثيرات السلبية للعناصر الخلفية. من خلال إعطاء الأولوية لأجزاء محددة من الصورة، يتعلم AT-ViT بشكل أكثر فعالية عن الأعضاء النباتية، ما يساعد على إنتاج تمثيلات مركزية للنبات.

أظهرت نتائج التجارب أن AT-ViT قدم تحسينات ملحوظة في دقة تصنيفات الصفات، مثل شكل قاعدة الورقة والأشواك، مما يعزز من قوة النموذج في استهداف مناطق النباتات. بالمقارنة مع نموذج CrossViT، تمكن AT-ViT من زيادة التوافق المكاني بنسبة تتراوح بين 15.66% و18.03%، كما استطاع تقليل التشويش الناتج عن الخلفيات الغير مثالية. علاوة على ذلك، أثبت AT-ViT كفاءته العالية حيث تجاوز أداء نموذج ResNet101 بنسبة 32.32 نقطة في دقة التصنيف.

باختصار، يعد AT-ViT علامة بارزة في المجال، مما يمهد الطريق لمزيد من التطورات والإمكانات في فهم ورعاية النباتات. كيف تعتقد أن هذه التقنية ستغير مستقبل علوم النبات؟ شاركونا آرائكم في التعليقات!