ה מאמר קודם התמקדנו בטכנולוגיה הידועה בשם STT. ניתחנו את היעילות והדיוק של טכנולוגיה זו, וכן כיצד גורמים שונים משפיעים על אופן פעולתה. בחלק זה, אני ושימון רוז'דז'ינסקי רוצים להתמקד בטכנולוגיה ההפוכה, המאפשרת לאלגוריתמים חכמים להמיר טקסט כתוב לדיבור.

בקצרה, TTS היא טכנולוגיה שלוקחת טקסט כתוב כקלט ומייצרת פלט מדובר מתאים. TTS נפוץ ביישומים כמו עוזרים קוליים, תכונות נגישות עבור אנשים עם לקות ראייה, ספרי שמע ותרחישים שונים אחרים שבהם נדרש קול טבעי להעברת מידע טקסטואלי.

הבה נבחן כיצד זה AI טכנולוגיית voicebot פועלת במגזר הבנקאי הפולני.

ניסוי בדיקת Text-to-Speech

בהערכת היעילות של שירותי המרת טקסט לדיבור (TTS) עבור תעשיית הבנקאות, הכנו מערך נתונים של טקסטים שנכתבו מראש. טקסטים אלו עובדו באמצעות מנועי TTS כדי לייצר פלטי אודיו, אשר לאחר מכן הושוו לסטנדרט הצפוי של דיבור אנושי טבעי. ניסוי TTS זה נועד להעריך באופן ביקורתי את יכולתן של טכנולוגיות נוכחיות להפיק דיבור שהוא לא רק מובן אלא גם מרתק ובעל צליל טבעי למשתמש, דבר החשוב במיוחד עבור מערכות אוטומטיות המשמשות בתעשיות הפונות ללקוחות כמו בנקאות.

מערכי נתונים

• 11 משפטים קצרים: פחות מ-20 טוקנים. משפטים אלה תוכננו לייצג מגוון של פניות ופקודות של לקוחות הנפוצות במגזר הבנקאות.
• 2 שיחות ארוכות: המשתרעות על למעלה מ-200 טוקנים. טקסטים ארוכים אלה נועדו לבחון את הסיבולת והעקביות של שירותי TTS בסימולציה של זרימת שיחה טבעית.

מדדי הערכה

כדי למדוד את הביצועים של שירותי TTS, השתמשנו במדדים הבאים:
• טבעיות: זה העריך עד כמה פלט ה-TTS חיקה באופן טבעי דיבור אנושי מבחינת טון, קצב והטעמה.
• פיסוק: נבחנה גם יכולתו של שירות ה-TTS לפרש ולהחיל כראוי את הקצב וההשהיות הנדרשים על ידי סימני הפיסוק בטקסט.
• מקיפות: בדקנו אם הפלט המדובר היה ברור ומובן לחלוטין, ובכך העביר ביעילות את המידע המיועד.
• ציון דעה ממוצע (MOS): איכות הפלטים של TTS הוערכה באמצעות ציון דעה ממוצע, מדד איכות סובייקטיבי נפוץ בעיבוד אודיו. מתוך הכרה באופי הסובייקטיבי של הערכה זו, ההערכות התבססו על תפיסות אישיות וממוצעו כדי להפיק דירוג כללי עבור כל פלט TTS.

פתרונות שנבדקו

החקירה שלנו בנושא שירותי טקסט לדיבור (TTS) עבור המגזר הבנקאי הפולני המשך עם הספקים שנבחרו קודם לכן עבור בדיקות המרת דיבור לטקסט (STT): Microsoft Azure ו Google Cloud Platform (GCP). פלטפורמות אלו נבחרו בשל השימוש הנרחב והתמיכה האיתנה שלהן בשפה הפולנית, ומבטיחות דיבור באיכות גבוהה ונשמע טבעי, חיוני ליישומי שירות לקוחות. חשוב לציין שהיינו צריכים להוציא את OpenAI Whisper המתארח ב-AWS מבדיקת ה-TTS, מכיוון שהוא מודל STT בלבד ואינו מציע יכולות TTS.

הגישה שלנו הייתה לבחור שלושה קולות פופולריים מכל ספק, כדי להבטיח ניתוח רחב והשוואתי בין הפלטפורמות הללו. עבור Azure, בחרנו לכלול את כל הקולות הנוירוניים הפולניים הנתמכים, מכיוון שהיו רק שלושה זמינים. לעומת זאת, GCP מציעה מגוון רחב יותר של קולות פולניים, עם כ-10 אפשרויות. כדי לשמור על היקף מאוזן ובר-ניהול למחקר שלנו, בחרנו רק שלושה מקולות אלו, בהתאמה למספר שנבדק מ-Azure.

הקולות שנבחרו היו:

Microsoft Azure:

  • pl-PL-AgnieszkaNeural
  • pl-PL-MarekNeural
  • pl-PL-ZofiaNeural

Google Cloud Platform (GCP):

  • pl-PL-Standard-B
  • pl-PL-Wavenet-B
  • pl-PL-Wavenet-C

הגדרה

מעריכים

צוות ההערכה כלל שני אנשים שהם דוברי פולנית כשפת אם. תפקידם היה חיוני בתהליך ההערכה, שכן הם סיפקו תובנות מומחים לגבי הטבעיות, הדיוק והמקיפות של פלטי ה-TTS.

תהליך הערכה

המעריכים העריכו את קבצי האודיו שנוצרו על ידי TTS, תוך התמקדות במדדי טבעיות, דיוק ומקיפות, כדי לקבוע עד כמה יעיל כל שירות חיקה דיבור אנושי.

סולם דירוג

המעריכים השתמשו בסולם דירוג של 1 עד 5 עבור כל מדד, כאשר 1 הוא הנמוך ביותר ו-5 הגבוה ביותר. סולם זה סיפק מדד כמותי לביצועים של כל שירות TTS, ואפשר תהליך הערכה מובנה ואחיד.

תוצאות

ההערכה המקיפה של שירותי טקסט לדיבור (TTS) הניבה מסקנות מעמיקות אודות ביצועיהם בהקשר של התחום הבנקאי הפולני. התוצאות הבאות מדגישות את היכולות המגוונות על פני מדדים שונים, ומציעות כי בחירת שירות TTS צריכה להיות ספציפית לקול ולא להתבסס solely על ספק הענן.

Voices' comparison -  table assessing naturalness, punctuation, comprehensiveness, mean.

טבלה 1 – השוואת Voices – טבלה הבוחנת טבעיות, פיסוק, מקיפות וממוצע.

טבעיות

התוצאות מצביעות על כך ש- Azure’s pl-PL-AgnieszkaNeural(4.04 +-0.45), GCP’s pl-PL-Wavenet-B(4.00 +-0.75), ו- Azure’s pl-PL-MarekNeural(3.92 +-0.74) היו המצטיינים בהערכת הטבעיות, עם הבדלים קלים בציוני הממוצע שלהם.

קולות אלה הובילו את התחום, מה שמעיד שהם מציעים את הדיבור הסינתטי הטבעי ביותר, תוך חיקוי מדויק של מאפייני הקול האנושי. לעומת זאת, שאר הקולות הציגו ירידה בטבעיות הנתפסת, עם ביצועים נמוכים באופן ניכר מ- Azure pl-PL-ZofiaNeural(2.38+-0.80), אשר פיגר למרות של-Azure שני קולות בקטגוריה העליונה. הדבר מצביע על שונות באיכות בקרב אותו ספק, כאשר Azure מציע גם אחד הקולות הטבעיים ביותר וגם אחד הקולות הפחות טבעיים מבין קולות ה-TTS בהערכה זו.

פיסוק

Azure’s pl-PL-MarekNeural הצטיין בפיסוק עם ציון ממוצע של 4.62 וסטיית התקן הנמוכה ביותר, מה שמעיד על ביצועים מדויקים ויציבים במיוחד ועל הסכמה בין המתייגים. הטוב ביותר של GCP, pl-PL-Wavenet-B, קיבל ציון מכובד של 4.19, מה שמעיד על מיומנות אך עם שונות רחבה יותר בין הדגימות.

מקיפות

גם הקולות של Azure וגם של GCP השיגו ציוני מקיפות מושלמים או כמעט מושלמים של 5.00, המעידים על הגייה צלולה כתוצאה והעברת מסר מוצלחת. המשמעות היא שבאופן כולל, המידע של המסר מועבר כראוי למאזין.

מסקנות

הגיע הזמן לסכם את הניסוי כולו. בהערכה של שירותי דיבור ציבורי עבור המגזר הבנקאי הפולני, גם Google Cloud Platform (GCP) וגם Microsoft Azure מתגלים כמתמודדים חזקים, המציעים יכולות חזקות ויעילות של המרת דיבור לטקסט והמרת טקסט לדיבור.

עבור יישומי טקסט לדיבור, חיוני לשקול את השונות בביצועי הקול באותה פלטפורמה, תוך הדגשת הצורך בבחירה קפדנית. למרות שהתמחור של GCP ו-Azure דומה, בחירת הפלטפורמה צריכה להתבסס על יכולות אינטגרציה ספציפיות והתשתית העננית הקיימת של הארגון הבנקאי.

ראוי גם לציין את הביצועים שלמודל Whisper של OpenAI בתחום שירותי המרת דיבור לטקסט, במיוחד בתרחישים עם רעש רקע משמעותי. ההערכה שלנו הדגישה כי Whisper מצטיין בסביבות עם אודיו רועש במיוחד, ומציג רמה גבוהה של עמידות ודיוק. הדבר הופך אותו לאפשרות בעלת ערך עבור יישומים במגזר הבנקאות שבהם אודיו ברור אינו תמיד זמין, כגון באינטראקציות שירות לקוחות טלפוניות.

עם זאת, חשוב לזכור שהמסקנות שהוסקו ממחקר זה עלולות להתיישן במהירות. אופי ה'קופסה השחורה' של ספקי שירותי ענן, כולל היכולת לעדכן משקולות מודל ללא הודעה מוקדמת, פירושו שהביצועים של שירותים אלו יכולים להשתנות באופן בלתי צפוי.

גורם זה מדגיש את ההכרח בניטור ובהערכה מחדש מתמשכים של טכנולוגיות אלו כדי להבטיח שהן ממשיכות לעמוד בצרכים התפעוליים ובסטנדרטים של התעשייה הבנקאית. אימוץ שירותים אלו צריך להיעשות מתוך הבנה של אופיים המתפתח ועם אסטרטגיות שיהיו מוכנות להסתגל לשינויים ולשיפורים פוטנציאליים בהצעותיהם.

מקרה בוחן של בוט קולי מבוסס AI

מאמר זה עסק בעיקר בניסוי, אך הצוות שלנו מנוסה גם ביישום פתרונות voicebot בתנאי מציאות. עבור אחד מלקוחותינו, מוסד פיננסי פולני מוביל, פיתחנו voicebot AI דובר פולנית באופן מלא מבית BoostAI. הוא פועל כמתווך לפני חיבור הלקוח ליועץ מתאים בצד Amazon Connect.

רוצה לדעת יותר על הפרויקט הזה? אנו מזמינים אותך לקרוא את מחקר המקרה הזה: אינטגרציה עוצמתית לשינוי שירות הלקוחות בבנקאות הפולנית.

ואם אתם רוצים שנתכנן משהו דומה עבור החברה שלכם, הצוות שלנו עומד לרשותכם. עיינו ב- offering וצרו איתנו קשר כדי לדון בצרכים שלכם.

המרת טקסט לדיבור (TTS) ממירה טקסט כתוב לאודיו מדובר. בבנקאות, היא תומכת בבוטים קוליים, באוטומציה של שירות לקוחות, בתכונות נגישות ובאינטראקציות טלפוניות שבהן תקשורת ברורה וטבעית חיונית.

גם Microsoft Azure וגם Google Cloud Platform מציעות יכולות TTS חזקות עבור פולנית. התוצאות מראות שהביצועים משתנים בהתאם לקול ולא בהתאם לספק, כך שבחירת מודל הקול הנכון חשובה יותר מבחירת פלטפורמה בלבד.

הטבעיות תלויה בטון, בקצב ובעוצמת הדיבור. קולות TTS באיכות גבוהה מחקים דפוסי דיבור אנושיים, כולל הפסקות והדגשות מתאימות, מה שהופך את האינטראקציות למרתקות יותר ולקלות יותר להבנה.

איכות TTS מוערכת בדרך כלל באמצעות מדדים כגון טבעיות, טיפול בפיסוק והבנה. ציון הדעה הממוצע (MOS), המבוסס על הערכה אנושית, משמש בדרך כלל למדידת איכות השמע הכוללת.

כן, פתרונות TTS מודרניים מספקים הבנה ובהירות גבוהות, מה שהופך אותם למתאימים לשימוש מול לקוחות. עם זאת, הביצועים עשויים להשתנות בין קולות ועשויים להשתנות עם הזמן, ולכן מומלץ לבצע הערכה תקופתית.