في عالم البيانات، تُعد مشكلة توقع القيم المفقودة في البيانات الجدولية من التحديات الأساسية التي تواجه الفرق المختصة في تنظيف البيانات. ورغم أن نماذج التفكير الحديثة أثبتت كفاءتها في هذا المجال، إلا أن نشرها على نطاق واسع يكون مكلفًا وأحيانًا ينتج عنها توقعات غير دقيقة أو خادعة.

أحدثت دراسة جديدة تفيد بأن الوصول إلى دقة عالية في توقع القيم المفقودة يتطلب دمجًا متميزًا لثلاث قدرات رئيسية: المعرفة العامة، والتفكير القائم على النصوص، والتفكير القائم على الأكواد. تم تطوير أسلوب جديد يسمى Auto-Fill، حيث تم تدريب ثلاثة نماذج لغوية صغيرة مخصصة (Specialist Language Models) كل منها مُصمم لتحسين قدرة محددة.

ويعتمد هذا الأسلوب على آلية مشتركة مُعيرة، تقوم إما باختيار النموذج المتخصص الأكثر ثقةً أو تتجنب اتخاذ القرار إذا كانت الثقة منخفضة، مما يضمن تحقيق دقة عالية بدون زيادة في التكاليف. أظهرت التجارب التي أجريت على 11 معيارًا مختلفًا، بالإضافة إلى 2200 جدول حقيقي من مجالات متنوعة، أن تقنية Auto-Fill تتفوق بشكل ملحوظ على نماذج التفكير الأخرى مثل o3-pro وGemini 3 Pro وDeepSeek R1، وذلك بتكلفة أقل بكثير (أقل من 1% من تكاليف هذه النماذج الرائدة).

تسلط هذه النتائج الضوء على فعالية التخصص والامتناع المُعَير في تحسين أداء معالجة البيانات الجدولية. وتتاح تقنية Auto-Fill للجمهور عبر منصة GitHub، مما يمكّن المزيد من الفرق من الاستفادة من هذا التطور الفريد في الذكاء الاصطناعي.