في عصر الذكاء الاصطناعي المتطور، تحتاج النماذج اللغوية إلى آليات قوية لتحسين قراراتها بطريقة موثوقة وفعالة. ومن هذه الآليات يأتي إطار العمل الجديد VERPO، والذي يرمز إلى "تحسين السياسات المتحقق بواسطة الأدلة المنتظمة" (Verified Evidence Regularized Policy Optimization). هذا الإطار يقدم طريقة فعالة لاستغلال المكافآت المستندة إلى النتائج القابلة للتحقق، مما يوجه نماذج اللغة بعد التدريب.
عندما تعالج النماذج اللغوية المعلومات، فإنها تحتاج إلى تمييز القرارات الصحيحة من غيرها. لكن، كما تشير الأبحاث، المزايا التي تكتسبها النماذج على مستوى التسلسل لا تساعد دائمًا في تحديد القرارات على مستوى الرموز التي ينبغي الاحتفاظ بها أو تعديلها. لذلك، تم تصميم "المعلمين الموجهين بالأدلة" (Evidence-conditioned Teachers) لتقديم إشراف أكثر كثافة من خلال إعادة تشغيل المسارات التي تم أخذ عينات منها مع ردود فعل متميزة. ومع ذلك، يجب توخي الحذر من تقليد غير محدد قد ينقل أنماط التنسيق أو أساليب التفكير التي لا تدعم النجاح في المهام.
يعمل VERPO على فصل استعادة المرجعية الخالية من الأدلة عن تصحيحات الرموز المعتمدة على الأدلة. يقدم "التحكم في زوايا اتخاذ القرارات" (ZPD) توسعًا في قبول التعديلات وفقًا لتوافق المكافآت المحلية وتكلفة حركة فيشر، مما يسهم في تحسين العملية دون التأثير على قناة الإرجاع.
تظهر النتائج المبهرة عبر خمس مهام تتعلق بالتفكير العلمي واستخدام الأدوات، حيث تفوق أفضل النسخ في كل هيكل عظام على أقوى المعايير مقارنة في متوسط الدرجات. على سبيل المثال، زادت الدرجات من 0.6826 إلى 0.6857 على نموذج Qwen3-4B، ومن 0.6895 إلى 0.7058 على نموذج Qwen3-8B، ومن 0.4751 إلى 0.5657 على نموذج Llama-3.2-1B.
مع هذه الابتكارات، يشير VERPO إلى مستقبل أفضل لتحسين نماذج الذكاء الاصطناعي، مما يعزز من قدرتها على اتخاذ قرارات دقيقة وموثوقة. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
إطلاق VERPO: الثورة في تحسين سياسات نموذج اللغة باستخدام الأدلة الموثوقة
تقدم VERPO إطارًا مبتكرًا لتحسين نماذج اللغة من خلال استخدام الأدلة الموثوقة. هذا التطور يعد خطوة جذرية نحو تحسين القدرة على اتخاذ القرارات بشكل أفضل في نماذج الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
