في عالم الذكاء الاصطناعي، تعتبر نماذج رؤية اللغة (Vision-Language Models) من أهم الابتكارات التي تسهم في فهم الصور والنصوص معًا. ومع ذلك، كانت تواجه هذه النماذج تحديًا رئيسيًا يتمثل في عدم قدرتها على التكيف مع الديناميكيات المتغيرة للمشاهد أثناء فترة المعالجة. هنا تأتي تقنية "فورسايت" (FORESIGHT) كخطوة ثورية في هذا المجال.

تظهر الأبحاث الأخيرة أن نماذج رؤية اللغة المتدفقة تمتلك بالفعل القدرة على توقع المستقبل. بمعنى آخر، يمكنها أن تتنبأ بالطريقة التي قد تتطور بها الأمور في الزمان القريب، وبالتالي، يمكنها تهيئة قدرتها الحسابية بشكل ديناميكي، كل ذلك دون الحاجة لإعادة تدريب.

تعتمد تقنية فورسايت على بنية مزدوجة مكونة من نموذجين توأميين (Siamese LLMs) يشتركان في الأوزان وواجهات الإدخال. يعمل النموذج الأول على معالجة الرموز الواردة بشكل مستمر، في حين يقوم النموذج الثاني بالعمل كمتنبئ يدرس السياق المستقبلي ويخطط للأداء المطلوب.

تسمح هذه الديناميكية بإجراء قرارات مخططة بشأن كيفية ومتى يجب التفكير مرة أخرى، وما يجب التحقق منه لاحقًا، مما يمكن النظام من تحسين أدائه في معالجة المعلومات الديناميكية.

تحقق تقنية فورسايت نتائج مذهلة في تقييمات الأداء، حيث حقق نموذج "كوين 3-في-إل-8 بي" (Qwen3-VL-8B) النتائج الأكثر تميزًا، متفوقًا بنسبة 9.5% على أقوى نموذج تم تدريبه مسبقاً.

بفضل هذه التقنية، أصبح بالإمكان تحسين أداء النماذج بشكل متواصل وبكفاءة عالية دون حاجة لوقت كبير أو تكلفة إضافية. كما سيجري إطلاق الشيفرة المصدرية لهذا الابتكار لتكون متاحة للجمهور.