الروبوتات الصوتية المدعومة بالذكاء الاصطناعي في القطاع المصرفي البولندي (الجزء 2)
الـ المقال السابق ركزنا على التقنية المعروفة باسم STT. حللنا فعالية ودقة هذه التقنية إلى جانب كيفية تأثير العوامل المختلفة على طريقة عملها. في هذا الجزء، أرغب أنا وSzymon Rożdzyński في التركيز على التقنية المعاكسة التي تتيح للخوارزميات الذكية تحويل النص المكتوب إلى كلام.
باختصار، TTS هي تقنية تأخذ النص المكتوب كمدخل وتولّد مخرجًا منطوقًا مقابلًا. يُستخدم TTS بشكل شائع في تطبيقات مثل المساعدين الصوتيين وميزات إمكانية الوصول للأفراد ذوي الإعاقة البصرية والكتب الصوتية وسيناريوهات أخرى متنوعة حيث تكون هناك حاجة لصوت طبيعي لنقل المعلومات النصية.
دعونا نلقي نظرة على كيفية AI تعمل تقنية الروبوت الصوتي في القطاع المصرفي البولندي.
تجربة اختبار تحويل النص إلى كلام
في تقييم فعالية خدمات تحويل النص إلى كلام (TTS) لقطاع الخدمات المصرفية، أعددنا مجموعة بيانات من نصوص مكتوبة مسبقًا. تمت معالجة هذه النصوص عبر محركات TTS لتوليد مخرجات صوتية، والتي تمت مقارنتها بعد ذلك بالمعيار المتوقع للكلام البشري الطبيعي. هدف تجربة TTS هذه إلى التقييم النقدي لقدرة التقنيات الحالية على إنتاج كلام ليس مفهومًا فحسب، بل أيضًا جذاب وطبيعي المظهر بالنسبة للمستخدم، وهو أمر بالغ الأهمية للأنظمة الآلية المستخدمة في القطاعات التي تتعامل مع العملاء مثل الخدمات المصرفية.
مجموعات البيانات
• 11 جملة قصيرة: أقل من 20 رمزًا. صُممت هذه الجمل لتمثّل مجموعة متنوعة من استفسارات العملاء والأوامر التي تُواجه عادةً في القطاع المصرفي.
• محادثتان طويلتان: تمتدان على أكثر من 200 رمز. تهدف هذه النصوص الأطول إلى اختبار قدرة خدمات تحويل النص إلى كلام (TTS) على التحمل والاتساق في محاكاة تدفق محادثة طبيعي.
مقاييس التقييم
لقياس أداء خدمات تحويل النص إلى كلام (TTS)، استخدمنا المقاييس التالية:
• الطبيعية: قيّم هذا مدى محاكاة مخرجات TTS للكلام البشري من حيث النبرة والإيقاع والتنغيم.
• علامات الترقيم: تم أيضاً اختبار قدرة خدمة TTS على التفسير الصحيح وتطبيق الإيقاع والوقفات التي تتطلبها علامات الترقيم في النص.
• الشمولية: تحققنا مما إذا كان الناتج المنطوق واضحًا ومفهومًا بالكامل، وبالتالي ينقل المعلومات المقصودة بفعالية.
• متوسط درجات الرأي (MOS): تم تقييم جودة مخرجات تحويل النص إلى كلام (TTS) باستخدام متوسط درجات الرأي، وهو مقياس جودة ذاتي شائع في معالجة الصوت. وإدراكاً للطبيعة الذاتية لهذا التقييم، استندت التقييمات إلى التصورات الفردية وتم حساب متوسطها للحصول على تقييم عام لكل مخرج من مخرجات تحويل النص إلى كلام.
الحلول المُختبرة
تحقيقنا في خدمات تحويل النص إلى كلام (TTS) لـ القطاع المصرفي البولندي واصلنا مع المزودين الذين تم اختيارهم سابقًا لاختبارات تحويل الكلام إلى نص (STT): Microsoft Azure و Google Cloud Platform (GCP). تم اختيار هذه المنصات نظرًا لاستخدامها الواسع النطاق ودعمها القوي للغة البولندية، مما يعد بكلام عالي الجودة وطبيعي الصوت وهو أمر ضروري لتطبيقات خدمة العملاء. من المهم ملاحظة أنه كان علينا استبعاد OpenAI Whisper المستضاف على AWS من اختبار تحويل النص إلى كلام (TTS)، لأنه نموذج تحويل الكلام إلى نص (STT) حصريًا ولا يوفر قدرات تحويل النص إلى كلام (TTS).
تمثلت مقاربتنا في اختيار ثلاثة أصوات شائعة من كل مزود، بما يضمن تحليلاً واسعًا ومقارنًا عبر هذه المنصات. بالنسبة لـ Azure، اخترنا تضمين جميع الأصوات العصبية البولندية المدعومة، حيث لم يكن متاحًا سوى ثلاثة منها. في المقابل، تقدم GCP مجموعة أوسع من الأصوات البولندية، بنحو 10 خيارات. وللحفاظ على نطاق متوازن وقابل للإدارة في دراستنا، اخترنا ثلاثة فقط من هذه الأصوات، بما يتوافق مع العدد الذي تم اختباره من Azure.
كانت الأصوات المختارة:
Microsoft Azure:
- pl-PL-AgnieszkaNeural
- pl-PL-MarekNeural
- pl-PL-ZofiaNeural
منصة Google Cloud (GCP):
- pl-PL-Standard-B
- pl-PL-Wavenet-B
- pl-PL-Wavenet-C
الإعداد
المقيّمون
تألف فريق التقييم من شخصين من الناطقين الأصليين باللغة البولندية. وكان دورهما جوهرياً في عملية التقييم، حيث قدما رؤى متخصصة حول طبيعية مخرجات تحويل النص إلى كلام ودقتها وشموليتها.
عملية التقييم
قيّم المقيّمون ملفات الصوت المولّدة بواسطة تحويل النص إلى كلام (TTS)، مع التركيز على مقاييس الطبيعية والدقة والشمولية، لتحديد مدى فعالية محاكاة كل خدمة للكلام البشري.
مقياس التقييم
استخدم المقيّمون مقياس تقييم من 1 إلى 5 لكل معيار، حيث يمثل 1 الأدنى و5 الأعلى. وفّر هذا المقياس قياساً كمياً لأداء كل خدمة TTS، مما أتاح عملية تقييم منظمة ومتسقة.
النتائج
أسفر التقييم الشامل لخدمات تحويل النص إلى كلام عن استنتاجات ثاقبة حول أدائها في سياق القطاع المصرفي البولندي. تُبرز النتائج التالية القدرات المتنوعة عبر مقاييس مختلفة، مما يشير إلى أن اختيار خدمة TTS يجب أن يكون خاصًا بالصوت بدلاً من الاعتماد فقط على مزود الخدمة السحابية.

الجدول 1 – مقارنة Voices – جدول يقيّم الطبيعية وعلامات الترقيم والشمولية والمتوسط.
الطبيعية
تشير النتائج إلى أن Azure’s pl-PL-AgnieszkaNeural(4.04 +-0.45)GCP pl-PL-Wavenet-B(4.00 +-0.75)، و Azure’s pl-PL-MarekNeural(3.92 +-0.74) كانوا الأفضل أداءً في تقييم الطبيعية، مع اختلافات طفيفة في متوسط درجاتهم.
قادت هذه الأصوات المجال، مما يشير إلى أنها تقدم الكلام المُصنَّع الأكثر طبيعية في النطق، مع محاكاة دقيقة لخصائص الصوت البشري. وفي المقابل، أظهرت الأصوات المتبقية تراجعًا في الطبيعة المُدرَكة، مع أداء أقل بشكل ملحوظ من Azure’s pl-PL-ZofiaNeural(2.38+-0.80)، والذي جاء متأخراً على الرغم من امتلاك Azure لصوتين في الفئة الأعلى جودة. يشير هذا إلى تباين في الجودة داخل المزود نفسه، حيث يقدم Azure أحد أكثر أصوات تحويل النص إلى كلام طبيعية وأحد أقلها طبيعية في هذا التقييم.
علامات الترقيم
Azure’s pl-PL-MarekNeural تفوقت في علامات الترقيم بمتوسط درجات 4.62 وأدنى انحراف معياري، مما يشير إلى أداء دقيق ومستقر للغاية وتوافق بين المصنفين. أفضل نتيجة لـ GCP، pl-PL-Wavenet-B، سجّل نتيجة محترمة بلغت 4.19، مما يُظهر الكفاءة ولكن مع تباين أوسع بين العينات.
الشمولية
حقق كل من صوتي Azure وGCP درجات شمولية مثالية أو شبه مثالية بلغت 5.00، مما يدل على نطق واضح تماماً وإيصال ناجح للرسالة. وهذا يعني أن معلومات الرسالة تُنقل بشكل صحيح إلى المستمع بشكل عام.
الاستنتاجات
حان الوقت لتلخيص التجربة بأكملها. في تقييم خدمات الخطاب العام للقطاع المصرفي البولندي، يبرز كل من Google Cloud Platform (GCP) وMicrosoft Azure كمرشحين أقوياء، تقديم قدرات قوية وفعّالة لتحويل الكلام إلى نص وتحويل النص إلى كلام.
بالنسبة لتطبيقات تحويل النص إلى كلام، من الضروري مراعاة التباين في أداء الأصوات ضمن نفس المنصة، مما يؤكد الحاجة إلى الاختيار الدقيق. على الرغم من أن تسعير GCP وAzure متقارب، إلا أن اختيار المنصة يجب أن يستند إلى قدرات التكامل المحددة والبنية التحتية السحابية الحالية للمؤسسة المصرفية.
ومن الجدير بالذكر أيضًا الإشارة إلى أداءنموذج Whisper من OpenAI في مجال خدمات تحويل الكلام إلى نص، لا سيما في السيناريوهات التي تحتوي على ضوضاء خلفية كبيرة. أبرز تقييمنا أن Whisper يتفوق في البيئات ذات الصوت شديد الضوضاء، مما يُظهر درجة عالية من المرونة والدقة. وهذا يجعله خيارًا قيّمًا للتطبيقات في القطاع المصرفي حيث قد لا يتوفر صوت واضح دائمًا، كما في تفاعلات خدمة العملاء عبر الهاتف.
ومع ذلك، من المهم أن نتذكر أن الاستنتاجات المستخلصة من هذا البحث قد تصبح قديمة بسرعة. إن الطبيعة «الصندوق الأسود» لمزودي الخدمات السحابية، بما في ذلك القدرة على تحديث أوزان النموذج دون إشعار مسبق، تعني أن أداء هذه الخدمات يمكن أن يتغير بشكل غير متوقع.
يؤكد هذا العامل على ضرورة المراقبة المستمرة وإعادة تقييم هذه التقنيات لضمان تلبيتها باستمرار للاحتياجات التشغيلية ومعايير القطاع المصرفي. يجب أن يتم اعتماد هذه الخدمات مع فهم طبيعتها المتطورة ومع وجود استراتيجيات للتكيف مع التغييرات والتحسينات المحتملة في عروضها.
دراسة حالة روبوت الصوت بالذكاء الاصطناعي
تناولت هذه المقالة التجربة بشكل أساسي، لكن فريقنا لديه أيضًا خبرة في تنفيذ حلول الروبوتات الصوتية في ظروف الحياة الواقعية. لأحد عملائنا، وهو مؤسسة مالية بولندية رائدة، طورنا روبوتًا صوتيًا ذكيًا ناطقًا بالبولندية بالكامل من BoostAI. يعمل كوسيط قبل ربط العميل بمستشار مناسب على جانب Amazon Connect.
هل ترغب في معرفة المزيد عن هذا المشروع؟ ندعوك لقراءة دراسة الحالة هذه: تكامل قوي لتحويل خدمة العملاء في القطاع المصرفي البولندي.
وإذا كنت تريد منا تصميم شيء مشابه لشركتك، فإن فريقنا في خدمتك. اطّلع على oتقديم وتواصل معنا لمناقشة احتياجاتك.
يحوّل تحويل النص إلى كلام (TTS) النص المكتوب إلى صوت منطوق. وفي القطاع المصرفي، يدعم الروبوتات الصوتية، وأتمتة خدمة العملاء، وميزات إمكانية الوصول، والتفاعلات الهاتفية حيث يكون التواصل الواضح والطبيعي أمرًا ضروريًا.
يقدم كل من Microsoft Azure وGoogle Cloud Platform قدرات قوية لتحويل النص إلى كلام باللغة البولندية. وتُظهر النتائج أن الأداء يتفاوت حسب الصوت وليس حسب المزود، لذا فإن اختيار نموذج الصوت المناسب أكثر أهمية من اختيار المنصة وحدها.
تعتمد الطبيعية على النبرة والإيقاع والتنغيم. تحاكي أصوات TTS عالية الجودة أنماط الكلام البشري، بما في ذلك الوقفات والتشديدات المناسبة، مما يجعل التفاعلات أكثر جذبًا وأسهل في الفهم.
عادةً ما يتم تقييم جودة تحويل النص إلى كلام باستخدام مقاييس مثل الطبيعية، والتعامل مع علامات الترقيم، وقابلية الفهم. يُستخدم متوسط درجة الرأي (MOS)، القائم على التقييم البشري، بشكل شائع لقياس جودة الصوت الإجمالية.
نعم، توفر حلول تحويل النص إلى كلام الحديثة درجة عالية من الفهم والوضوح، مما يجعلها مناسبة للاستخدام الموجه للعملاء. ومع ذلك، قد يختلف الأداء بين الأصوات وقد يتغير بمرور الوقت، لذا يُوصى بالتقييم المنتظم.