واشنطن-سانا
أعلنت شركة «ميتا» تطوير تقنية جديدة تعتمد على الذكاء الاصطناعي لتحويل الكلام إلى نص بصورة فورية، مع قدرات للتعرف إلى المتحدثين وفصل أصواتهم، والتعامل مع المحادثات متعددة اللغات والتسجيلات الصوتية الطويلة.
وذكر موقع «Gadgets 360» التقني في تقرير نشره أمس الأربعاء أن «ميتا» أطلقت التقنية في الأول من أيلول الجاري، وهي تدعم أكثر من 70 لغة، ويمكنها التمييز بين أكثر من 20 متحدثاً في التسجيل الواحد، فضلاً عن معالجة تسجيلات صوتية تتجاوز مدتها ساعة.
وتتيح التقنية تحويل الكلام إلى نص أثناء تحدث المستخدم مباشرة، دون الحاجة إلى الانتظار حتى انتهاء التسجيل، ما يجعلها مناسبة للاجتماعات والمقابلات والمحادثات الطويلة وخدمات الإملاء الصوتي.
كما تتعرف إلى أصوات المتحدثين وتفصل حديث كل منهم، مع تحديد بداية كلام كل شخص ونهايته تلقائياً، ما يسهم في تنظيم النص الناتج عن التسجيلات التي تضم عدة متحدثين.
وتدعم التقنية المحادثات التي ينتقل فيها المشاركون بين لغتين أو أكثر، حتى عندما يحدث الانتقال بين اللغات ضمن الجملة نفسها، دون الحاجة إلى تغيير إعدادات اللغة يدوياً أثناء التسجيل.
وأوضحت «ميتا» أن التقنية تعتمد على معالجة الصوت في مقاطع قصيرة، وتحدد المدة المناسبة للاستماع قبل تحويل الكلام إلى نص، بهدف تحقيق توازن بين سرعة ظهور النص ودقة التعرف إلى الكلمات.
وتشمل اللغات المدعومة مجموعة واسعة من اللغات العالمية، إضافة إلى خمس لغات رئيسية مستخدمة في الهند، هي الهندية والتاميلية والتيلوجوية والكانادية والمالايالامية.
وأتاحت «ميتا» التقنية للمطورين لدمج إمكانات تحويل الكلام إلى نص في تطبيقاتهم وخدماتهم المختلفة، كما بدأت باستخدامها في بعض خدماتها المرتبطة بالإملاء الصوتي والتعامل مع المحتوى الكلامي.
وتأتي هذه التقنية في ظل تنامي المنافسة بين شركات التكنولوجيا لتطوير أدوات قادرة على فهم الكلام ومعالجته بصورة فورية، مع اتساع استخدام المساعدات الذكية وخدمات الإملاء الصوتي وتفريغ الاجتماعات والمقابلات.