تُعد إزالة الضبابية من الصور إحدى التحديات الكبرى في مجال رؤية الحاسوب، حيث تسعى هذه التقنية إلى استعادة الصور الواضحة من تلك الضبابية الناجمة عن الحركة أو اهتزاز الكاميرا. على الرغم من أن الأساليب المعتمدة على التعلم العميق مثل الشبكات العصبية التلافيفية (CNNs) ومحولات الرؤية (Vision Transformers) قد أحرزت تقدمًا ملحوظًا، إلا أنها غالبًا ما تواجه صعوبات مع الضبابيات المعقدة أو ذات الدقة العالية، بالإضافة إلى المطالب الحسابية الكبيرة.
في دراسة حديثة، تم اقتراح معمارية جديدة تضم محورين رئيسيين: محولات الرؤية ووحدة FFT-ReLU الخاصة بتردد الصورة، مما يعزز من قدرة استعادة التفاصيل عن طريق دمج نمذجة الانتباه المكاني مع التكرار النادر في الترددات. تتيح هذه المعمارية لمحولات الرؤية التقاط التبعيات المحلية والعالمية في الصورة، بينما تفرض وحدة FFT-ReLU التكرار النادر في المجال الترددي، مما يساعد على تقليل العيوب الناتجة عن الضبابية والحفاظ على التفاصيل الدقيقة.
أظهرت التجارب الواسعة التي أجريت على مجموعات البيانات القياسية تفوق هذا التصميم الجديد في قياسات مثل PSNR وSSIM، فضلاً عن الجودة الإدراكية مقارنة بالنماذج الأخرى الأكثر حداثة. تؤكد المقاييس الكمية والتقييمات النوعية فضلًا عن تفضيلات المشاركين البشريين فعالية هذه النهج الجديد، مما يؤسس لنمط عملي وقابل للتطبيق في استعادة الصور في العالم الواقعي.
بفضل هذه التطورات، يتجه مجال رؤية الحاسوب نحو آفاق جديدة من الفرص والإمكانيات. ما رأيكم في هذا الابتكار الجديد؟ شاركونا آراءكم في التعليقات!
تحول مثير في معالجة الصور: دمج محولات الرؤية مع FFT-ReLU لتقنية إزالة الضبابية!
تكشف دراسة جديدة عن ابتكار مذهل يجمع بين محولات الرؤية (Vision Transformers) ووحدة FFT-ReLU، مما يعزز من كفاءة إزالة الضبابية في الصور. النتائج تشير إلى تفوق هذه الطريقة على النماذج التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
