في عالم الذكاء الاصطناعي، تمثل نماذج اللغة العملاقة (Large Language Models - LLM) قفزة نوعية في تحسين فهم الآلة للغة البشرية. ومع ذلك، يواجه الباحثون تحديات متعددة، خاصة في ما يتعلق بتحيّز المعلم. هذا التحامل يمكن أن ينتقل إلى نموذج الطالب خلال عملية التقطير (Distillation) إذا لم يتم التعامل معه بشكل فعال.

في دراسة حديثة، اقترح الباحثون خوارزمية جديدة تُسمى Coupled Calibration and Learning (CCL) تهدف إلى مواجهة هذه المشكلة. تعتمد الخوارزمية على دمج عملية دقة المعلم مع تحديثات الطالب من خلال تفرع يعتمد على مستوى التوكن، مما يسمح بتغذية مرتدة على الأسئلة المصدر فقط. تستند كل دورة إلى تأكيد دقة المعلم باستخدام تغذية مرتدة المصدر، ثم تدريب الطالب على الأسئلة المستهدفة. وبذلك، يتمكن الطالب المحدث من تعزيز الدقة على الأسئلة الأكثر تعقيدًا.

هذا النهج الذي يعتمد على السياسة الذاتية (Autoregressive Policy) يظهر نتائج واعدة، حيث أثبت الباحثون أن الانحراف المتوقع لطالب التدريب عن الطالب المرجعي (Oracle Student) يتجه نحو الصفر بمعدل متعدد الحدود مع زيادة عدد الدورات. هذه النتيجة تشير إلى أن قدرة الخوارزمية الجديدة لا تقتصر فقط على تحسين دقة النماذج، بل تتجاوز أيضًا تحيّز المعلم بصورة ملحوظة.

بالمختصر، يُظهر هذا الابتكار فعالية في تحسين نماذج التعلم، بحيث يمكن تحقيق النتائج المثلى حتى دون الحاجة لتغذية مرتدة خاصة بالنطاق المستهدف. هذه الخوارزمية تمثل خطوة جديرة بالاهتمام في عالم الذكاء الاصطناعي، مما يعزز من دقة وكفاءة آليات التعلم الميكانيكية.