يعد فهم وظائف البروتينات وسلوكها الأساسي أحد الأشياء الأكثر تعقيدًا في علم الأحياء الجزيئي. البروتينات تؤدي وظائف خلوية متنوعة، وأحيانًا تؤدي تعديلات بسيطة على الأحماض الأمينية إلى تغييرات كبيرة في الاستقرار والنشاط والتفاعلات الجزيئية. هنا يأتي دور نماذج لغات البروتينات (Protein Language Models - PLMs) التي توفر طرقًا قابلة للتوسع لنمذجة هذه العلاقات بين التسلسل والوظيفة من تسلسلات غير موسومة.

في هذا السياق، ظهر بروتولينغو (ProtLingo) كنظام متكامل وحديث لتجاوز تحديات النموذج التقليدي. يعتمد بروتولينغو على إضافة ذاكرة محلية شرطية وتوجيهات خبير متخصص إلى هيكل نموذج واحد مسبق التدريب.

التقنية الجديدة تعتمد على تحويل تمثيلات بقايا البروتين إلى رموز منفصلة محددة بطرق معينة، وتجميع نوافذ محلية مركزة في عناوين N-gram كامن، واسترجاع إشارات متبقية قابلة لإعادة الاستخدام مرتبطة بسياقات تسلسل محلية متكررة.

عملت هذه الابتكارات جنبًا إلى جنب مع إعادة استخدام كتل التغذية الأمامية المختلفة كي تتحول إلى طبقات Mixture-of-Experts Sparse التي تضم خبراء مشتركين وموجهين، مما يتيح حسابات تعتمد على بقايا محددة أثناء تنشيط مجموعة فرعية من المعلمات.

أظهرت التجارب التي شملت توقع ملاءمة البروتين، ومعايير FLIP، بالإضافة إلى التنبؤ بالاتصالات تحت إشراف، أن بروتولينغو يحقق أداءً تنافسياً حتى مع هيكل 150 مليون معلمة، مع توفير كفاءة قوية في المعلمات عند توقع تأثير الطفرات والحفاظ على تمثيلات هيكلية بطول المدى.