أعلنت شركة جوجل عن إطلاق نموذجها الجديد Gemini 3.5 Transcribe، وهو نموذج مبتكر لتحويل الكلام إلى نصوص يتيح للمطورين بناء تطبيقات ذكية ذات قدرة فائقة على فهم وتحليل الصوت. يتميز هذا النموذج بنظامين مختلفين، وهما:

1. **نظام البث المباشر (Streaming Endpoint)**: يقدم خيارات تحويل الكلام إلى نص بسرعات دون الثانية، لكنه يفتقر إلى ميزتي تعقب المتحدث (Speaker Diarization) وتوقيت الكلمات (Word Timestamps).

2. **نظام الدفع (Batch Endpoint)**: يحتفظ بالمزايا المذكورة ولكنه يأتي بتكلفة أقل تبلغ نصف تكلفة النظام الأول.

وحسب التقديرات المقدمة من جوجل، يمتلك النظام معامل خطأ في الكلمات (Word Error Rate) يبلغ 4.0% للنموذج البث المباشر و2.6% للنموذج غير المباشر، مع تحسين يصل إلى 70% في سرعة إنهاء العملية عند مقارنته بنموذج Chirp 3.

هذا التوزيع يعني الكثير لمن يعمل في تطوير الوكالات الصوتية أو خطوط نقل الكلام، حيث يمكنهم اختيار النظام الذي يلبي احتياجاتهم بشكل أفضل. إن نموذج Gemini 3.5 Transcribe يعد خطوة إضافية نحو تحسين أدوات الاتصال الرقمي وفتح الأبواب لتجارب مستخدم أفضل.

هل أنتم مستعدون لاستكشاف كيف سيمكنكم هذا النموذج من تحسين تجربتكم في تحويل الكلام إلى نصوص؟ شاركونا أفكاركم في التعليقات!