تشهد تقنيات استرجاع المعلومات (IR) تطورًا مذهلاً في الفترة الأخيرة، حيث تتمكن من تحسين دقة التصنيف وملاءمة النتائج من خلال استخدام تمثيلات كثيفة ونادرة، فضلاً عن نماذج اللغات الضخمة (Large Language Models) ونماذج استرجاع متخصصة. ومع إضافة تقنيات مكمّلة مثل فهرسة الفقرات وتحليل تخطيط الوثائق وتمثيل المعرفة الدلالية، يتم تعزيز فعالية الاسترجاع من خلال التقاط المعلومات السياقية والبنيوية الدقيقة.
لقد طوّر الباحثون إطار عمل وكيل مبتكر يجمع بين هذه التقنيات لتعزيز التطبيقات عبر مجالات متنوعة، مع التركيز على التقييم الدقيق والاعتبارات الأخلاقية والموثوقية، مما يضمن نشرًا مسؤولًا في البيئات الواقعية. ويقترح هذا الإطار الجديد خط أنابيب قائم على الوكلاء لاستخراج السمات النباتية، حيث تستخدم تقنية التعرف الضوئي على الحروف (OCR) لتحويل ملفات PDF إلى نصوص قابلة للقراءة الآلية، بينما تنظم عمليات تقسيم وفهرسة المحتوى حسب الجنس والأنواع.
تقوم المحللات القائم على القواعد باستخراج السمات النباتية المهيكلة، بينما تساعد مجموعات من نماذج اللغات الضخمة (LLMs) في توسيع مفردات السمات وحل الغموض. وهذه الطريقة تضمن التعرف الدقيق على الأنواع وتوثيقًا قابلاً للتوسيع وتكاملاً واضحًا للوصف النصي النباتي، مما يتيح استخراج بيانات قوية وقابلة للتفسير عبر مجموعات نباتية كبيرة.
من خلال استخدام ثلاث مجموعات بيانات إقليمية نباتية، تمكن النظام من استخراج 55,737 تعليمة سمة عبر 4,961 نوعًا، بمتوسط 9.1 سمات لكل نوع. كما أدت تكاملات التحسين المدعومة بنماذج اللغات الضخمة (LLM) إلى تحسين التغطية لنحو 75% من السمات، مما زاد مجموع التعليقات بنسبة 59%. وعلى الرغم من أن اختيار محرك التعرف الضوئي على الحروف كان له تأثير طفيف على التعرف على الأنواع، فإن الأعداد الإجمالية للتعليقات ظلت مستقرة، مما يظهر قوة واستدامة وموثوقية هذا الخط من الأنابيب لاستخراج السمات النباتية على نطاق واسع.
إطار وكيل مبتكر يجمع بين القواعد ونماذج اللغات الضخمة لتحليل مستندات النباتات!
حقق إطار العمل الجديد المبتكر تقدمًا ملحوظًا في استخراج السمات النباتية باستخدام تقنيات حديثة. بفضل نماذج اللغات الضخمة (LLMs) وتحليل تخطيط الوثائق، تم تحسين دقة التعرف على الأنواع وزيادة التوثيق بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
