في خطوة مثيرة نحو مستقبلٍ أكثر كفاءة في مجال التعرف على الكلام، تم تقديم تقنية جديدة تهدف إلى تحويل البيانات الصوتية من مستشعرات عصبية إلى إشارات عصبية باستخدام الشبكات العصبية المتصاعدة (Spiking Neural Networks). هذه التقنية تعتبر حلاً واعدًا لتقليل التكاليف الطاقوية المرتبطة بتطبيقات الذكاء الاصطناعي.
حيث أن قلة البيانات المتاحة بشكل أصلي للمستشعرات العصبية تشجع على تطوير أدوات برمجية تُعنى بترجمة البيانات الحسية إلى إشارات متصاعدة، إلا أن تنفيذ المحاكيات ذات التماثل الحيوي قد يكون تحديًا على الأجهزة الرقمية. في هذا العمل، قمنا بتقييم الترميز العصبي والتمييز اللاحق للأصوات إلى إشارات باستخدام مُرمز عالي المستوى وغير قابل للتعلم، ومُستهدف للتنفيذ على الأجهزة القابلة للبرمجة FPGA.
تُظهر النتائج أن هذه التقنية تتيح تحقيق كفاءة مرتفعة في المعالجة، مع قياسات تعتمد على النشاط المتصاعد الكمي. وتركز الدراسة على تحسين متزامن لكل من المُرمز والمُصنف: حيث يمد المُرمز البيانات بشكل كفء ومفيد مما يُمكن المُصنف من تحقيق أداء أفضل بتكلفة طاقة أقل أثناء التعلم والاستدلال.
تُعتبر هذه العمل الأول من نوعه الذي يقدم الترميز العصبي الشامل بالإضافة إلى تقييم مجموعة بيانات TIMIT. تمكنت الشبكة العصبية التقدمية من تحقيق دقة تصنيف مذهلة تصل إلى 99.77% على بيانات إدخال إشارات متصاعدة، متجاوزة بذلك السجل العصبي المتطور في هذا المقياس. إن هذا الإنجاز يسلط الضوء على الإمكانيات الكبيرة للتقنيات العصبية المتقدمة في تحسين أداء أنظمة التعرف على الكلام ويؤكد على ضرورة الاستثمار المستمر في هذا المجال.
تحويل الصوت إلى إشارات عصبية: ثورة جديدة في التعرف على الكلام باستخدام الذكاء الاصطناعي
تقدم الدراسة الجديدة تقنية مبتكرة لتحويل الصوت إلى إشارات عصبية، مما يُعد خطوة مهمة نحو تقليل تكاليف الطاقة في تطبيقات الذكاء الاصطناعي. تبرز النتائج إمكانية تحقيق دقة تصنيف تصل إلى 99.77% باستخدام بيانات TIMIT.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
