تُعتبر نماذج اللغات الضخمة (LLMs) من أبرز التطورات في مجال الذكاء الاصطناعي، إلا أنها تواجه تحديات في التعامل مع سياقات طويلة جداً نتيجة للحدود الثابتة للسياق. ولحل هذه المشكلة، تم إدخال الطرق التتابعية مثل MemAgent، التي تقوم بتوسيع السياق الفعال من خلال قراءة النص في مقاطع وتحديث ذاكرة ثابتة الحجم بشكل متكرر. لكن، على الرغم من فاعلية هذا الأسلوب، فإنه يعاني من زمن تأخير مرتفع ويتطلب تدريباً مكلفاً عبر التعلم التعزيزي (Reinforcement Learning)، مما قد يؤدي إلى الإفراط في التكيف مع مجموعات بيانات معينة.
لتجاوز هذه التحديات، تم اقتراح ConvMem، وهو إطار عمل يمكن اعتماده دون الحاجة إلى تدريب، ويسمح بتوزيع العمليات بشكل عالي. يستلهم ConvMem من الشبكات العصبية الالتفافية (CNNs)، حيث يعتبر نموذج اللغة الضخم المحفز باستفسار معين نواة التوصيل. تقوم هذه النواة بتلخيص مقاطع النص بشكل هرمي، مختصرة مسار الاستدلال من سلسلة خطية إلى شجرة لوغاريتمية.
تقنياً، يدمج ConvMem "خطوات قابلة للتكوين" و"وصلات تخطي" لضمان التقاط الأدلة بقوة ونقلها، مستخدماً "التوصيل متعدد النواة" لتفكيك الاستفسارات المعقدة إلى قنوات دلالية منفصلة. هذا التصميم لا يقلل فقط من تراكم الأخطاء، بل يمكّن أيضاً من المعالجة المتواصلة عبر كل من مقاطع النص وخيوط الاستدلال.
أظهرت التجارب التي أجريت على RULER-HotpotQA و RULER-2WikiMultiHopQA أن ConvMem يتفوق على النماذج الأساسية التي لا تتطلب تدريباً، ويتجنب خطر الإفراط في التكيف الذي غالباً ما يُلاحظ في نماذج التعلم التعزيزي عند معالجة مهام خارج التوزيع. يبدو أن ConvMem سيفتح آفاقاً جديدة في قدرة نماذج الذكاء الاصطناعي على التعامل بكفاءة مع النصوص طويلة السياق.
ConvMem: ثورة جديدة في معالجة السياقات الطويلة باستخدام الذاكرة الالتفافية
يقدم ConvMem طريقة مبتكرة لمعالجة السياقات الطويلة عبر تقنيات جديدة تمنح نماذج اللغات الضخمة (LLMs) القدرة على التعامل بشكل أكثر كفاءة مع النصوص الطويلة. هذا الابتكار يعد خطوة هامة نحو تحسين الأداء وتقليل المخاطر المرتبطة بالتعلم التعزيزي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
