في عالم البيانات المتزايد، يعتبر النظام الذاتي لتحديد الكيانات (Entity Resolution) أحد الأدوات الأساسية التي تساعد في تحليل البيانات ودمج المعلومات المتعلقة بكائنات معينة. وقد جرت تجربة مهمة لبناء وتقييم نظام تحديد الكيانات الذاتي على ستة معايير مختلفة، تتراوح سجلاتها من 864 إلى 5 ملايين سجل. جميع هذه المعايير أسفرت عن ثلاثة دروس هامة لم تُطرح في الأدبيات السابقة لتحديد الكيانات.

**الدروس المستفادة:**
1. **لا يوجد خوارزمية تتفوق في كل مكان**: نظرًا لأن النظام الذاتي لا يستطيع توقع مجموعة البيانات التالية، يُنصح بتدريب عدة عائلات من الخوارزميات لكل مجموعة بيانات والسماح لآلية تلقائية باختيار الأفضل.
2. **يحتاج كل من الدقة والاسترجاع إلى حلول منفصلة**: بينما تحتاج الدقة إلى قواعد صارمة تمنع الأخطاء، فإن الاسترجاع يحتاج إلى مجموعة متنوعة من خيارات المرشحين لضمان شموليته.
3. **رابط خاطئ قد يدمج كيانات غير ذات صلة**: قد يؤدي الافتراض بأن "A تطابق B" و"B تطابق C" إلى الاستنتاج الخاطئ بأن "A تطابق C"، مما يسمح لرابط خاطئ واحد بتجميد مئات السجلات. لذلك، يجب التحقق من كل دمج بين المجموعات بشكل نشط.

نأمل أن تساعد هذه الدروس المعنيين في توفير الأشهر التي قد تهدر في تجارب غير مثمرة.