في عالم الفكاهة، يعد الإدراك الصحيح عاملاً حاسمًا، ليس فقط للحصول على الجواب الصحيح، بل لفهم المعاني العميقة وراء النكات. مؤخراً، أُجريت دراسات على فهم الفكاهة باستخدام معايير مثل مسابقة كاريكاتير نيويوركر، لكن هذه الدراسات غالبًا ما تتعامل مع الفهم كعملية مغلقة، مما يتجاهل العمليات المنهجية الضرورية.
فقد قدم الباحثون إطار IRS (Incongruity-Resolution Supervision) الذي يُقسم فهم الفكاهة إلى ثلاثة عناصر رئيسية:
1. **نموذج عدم التطابق (Incongruity Modeling)**: يحدد الفجوات في المشهد المرئي.
2. **نموذج الحل (Resolution Modeling)**: يبني إعادة تفسير متسقة لهذه الفجوات.
3. **محاذاة التفضيلات (Preference Alignment)**: تقيم التفسيرات المرشحة وفقًا للأحكام البشرية.
يستند IRS إلى نظرية عدم التطابق-الحل وممارسات الكابشنست المحترفة، مما يجعله إطارًا تأثيريًا يمكن تعلمه من خلال تتبع العمليات المنهجية التي توضح المسار من الإدراك البصري إلى التفسير الفكاهي.
تظهر النتائج أن استخدام IRS على نماذج 7B، 32B، و72B يُحسن الأداء في مطابقة العناوين وتصنيفها، حيث حققت نموذج IRS-72B الأداء الأقوى في التصنيف بنسبة 76.10%، متجاوزة أداء البشر غير الخبراء وجميع النماذج المتعددة الوسائط المستندة إلى المصادر المفتوحة والمغلقة. بالإضافة إلى ذلك، يُظهر التحويل بلا تعلّم أن IRS يتعلم أنماط تفكير قابلة للتعميم.
في نهاية المطاف، يعيد IRS تشكيل طريقة فهمنا للفكاهة ويعزز قدرة نماذج الذكاء الاصطناعي على إدراك الفروق الدقيقة في العالم الفكاهي.
تعلم التفكير كفنان كاريكاتير: إطار جديد لفهم الفكاهة المتعددة الوسائط
يسلط هذا البحث الضوء على أهمية الفهم المعرفي في فكاهة الكاريكاتير، مقدمًا إطارًا مبتكرًا يُسمى IRS. يهدف IRS إلى تحسين أداء نماذج الذكاء الاصطناعي في التعرف على الفكاهة من خلال تحليل العلاقات غير المتطابقة في الصور.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
