في عالم الذكاء الاصطناعي، باتت النماذج الصغيرة للغة الرؤية (Vision-Language Models) تكتسب أهمية متزايدة، لكنها غالباً ما تواجه تحديات في جمع المعلومات الخارجية. في محاولة لتجاوز هذه العقبات، تم تقديم تقنية جديدة تُعرف باسم 'Harness Compilation' (HC)، وهي إجراء يعمل بشكل غير متصل لتوزيع العمل بين نموذج صغير للغة الرؤية ومجموعة خارجية تعزز من قدراته.

يقوم معلم كبير باستخدام تجارب تنفيذ الطلاب لصياغة محتوى قابل لإعادة الاستخدام والتحكم، بينما يساعد مجموعة منفصلة في اختيار المجموعة المنفذة بفعالية. هذا يعني أن عملية النشر لا تتطلب تحديثات للوزن أو استدعاءات للمعلم، مما يسهل عملية التنفيذ.

لقد أثبتت التجارب عبر سبعة إعدادات مختلفة لمعالجة الأسئلة المرئية، أن تقنية 'HC' قد حسنت النتائج بمتوسط يتراوح بين 9.9 إلى 23.9 نقطة، مما يدل على كفاءتها في رفع أداء النماذج الطلابية التي تحتوي على ما يصل إلى 9 مليار معلمة. توضح التدخلات في خمسة أنواع من قرارات التشغيل (مثل الاستدعاء، الاختيار، توليد الحجج، دمج الأدلة، والامتناع) أهمية هذا التوزيع في المهام، حيث إن طلب الأدلة وتوليد الاستفسارات المفتوحة يمكن أن يكون مكلفًا، بينما تبقى الخيارات المحدودة وقراءة النصوص المُعطاة مفيدة.

تعزز بطاقات الحقائق (Fact Cards) أداء جميع النماذج العشرة التي تم تقييمها، ولكن سياسات اتخاذ القرار تنتقل بشكل غير متساوٍ. إن إعادة التجميع لنموذج طالب جديد تساعد عندما لا تتناسب الواجهة المنقولة مع الطالب الحالي. مع 100 عنصر ممارسة، تفوق 'HC' على النتائج الواردة فقط 'LoRA' في ثلاث مهام. علاوة على ذلك، يمكن أن تتطابق الميزانيات التدريبية الأكبر مع أو تتجاوز مجموعة ثابتة، بينما يؤدي الجمع بين التقنيتين إلى تحسين 'SlideVQA' بصورة تفوق أي منهما بمفرده.

تدعم هذه النتائج فكرة تخصيص العمل استنادًا إلى السلوك المقاس للطلاب، بدلاً من إزالة القرارات بشكل موحد، مما يقدم طاقة جديدة لتحسين الأداء في نماذج الذكاء الاصطناعي.