في عالم التكنولوجيا الحديثة، تُعد واجهات المستخدم (User Interfaces) أحد العناصر الأساسية التي تعتمد عليها الأنظمة الذكية في التفاعل مع المستخدمين. ولكن، كيف يمكن للنماذج اللغوية الترؤية (Vision-Language Models) أن تحسن من قدرة تلك الأنظمة على تحديد الواجهات بدقة؟ هنا يظهر دور تقنية GUI-Lens الجديدة.
تقدم GUI-Lens إطار عمل متقدماً يتيح لنموذج لغوي ترؤيفي تطوير عملية تحديد الأهداف بسهولة من خلال ملاحظات بصرية نشطة. حيث تتمكن هذه التقنية من استخراج النصوص باستخدام تقنية التعرف البصري على المحارف (OCR) وتحديد المكونات البصرية من الصورة المعروضة. يتم تقديم هذه التفاصيل كمراجع هندسية، الأمر الذي يمكن النموذج من اختيار المنطقة المطلوبة وتكبيرها للحصول على تفاصيل أدق.
يستمر هذا العملية حتى يتم تحديد الهدف بدقة، حيث تُراجع الاقتراحات والضغطات طوال هذه العملية حتى تتم المطابقة مع التعليمات المعطاة. التجارب التي أُجريت على أربعة معايير لـ GUI-grounding أظهرت أن GUI-Lens تُحسن من دقة التحديد بنسبة تصل إلى 24.9 نقطة مئوية، ما يجعلها تحقق أداءً رفيع المستوى باستخدام نموذج GPT-5.5.
إن هذه التقنية ليست مجرد تحسين عادي، بل هي خطوة كبيرة نحو مستقبل تعتمد فيه الأنظمة على الذكاء الاصطناعي لفهم واجهات المستخدم بشكل أكثر دقة. هل أنتم مستعدون لاستكشاف مزيد من التحسينات في الذكاء الاصطناعي؟
إطلاق GUI-Lens: ثورة في دقة تحديد واجهات المستخدم باستخدام نماذج لغات رؤيوية متقدمة!
تم تصميم تقنية GUI-Lens الجديدة لتحسين دقة تحديد واجهات المستخدم من خلال دمج التعليمات النصية مع الملاحظات البصرية. تضيف هذه التقنية لمسة جديدة على كيفية تفاعل الأنظمة مع واجهات المستخدم، ما يجعلها أكثر دقة وفاعلية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
