Les voicebots IA dans le secteur bancaire polonais (partie 2)
Le article précédent axée sur la technologie connue sous le nom de STT. Nous avons analysé l'efficacité et la précision de cette technologie, ainsi que l'impact de différents facteurs sur son fonctionnement. Dans cette partie, Szymon Rożdzyński et moi-même souhaitons nous concentrer sur la technologie opposée, qui permet à des algorithmes intelligents de convertir un texte écrit en parole.
En bref, la TTS est une technologie qui prend un texte écrit en entrée et génère une sortie vocale correspondante. La TTS est couramment utilisée dans des applications telles que les assistants vocaux, les fonctionnalités d'accessibilité pour les personnes malvoyantes, les livres audio et divers autres scénarios où une voix naturelle est nécessaire pour communiquer des informations textuelles.
Voyons comment cela AI la technologie des agents vocaux fonctionne dans le secteur bancaire polonais.
Expérience de test de synthèse vocale
Pour évaluer l'efficacité des services de synthèse vocale (TTS) dans le secteur bancaire, nous avons préparé un ensemble de textes pré-écrits. Ces textes ont été traités par des moteurs TTS afin de générer des sorties audio, qui ont ensuite été comparées au standard attendu de la parole humaine naturelle. Cette expérience TTS visait à évaluer de manière critique la capacité des technologies actuelles à produire une parole non seulement compréhensible, mais aussi engageante et naturelle pour l'utilisateur, ce qui est particulièrement important pour les systèmes automatisés utilisés dans les secteurs en contact avec la clientèle comme la banque.
ENSEMBLES DE DONNÉES
• 11 phrases courtes : moins de 20 tokens. Ces phrases ont été conçues pour représenter une variété de demandes et de commandes clients couramment rencontrées dans le secteur bancaire.
• 2 longues conversations : dépassant 200 tokens. Ces textes plus longs visent à tester l'endurance et la cohérence des services TTS dans la simulation d'un flux de conversation naturel.
INDICATEURS D'ÉVALUATION
Pour mesurer les performances des services TTS, nous avons utilisé les métriques suivantes :
• Naturel : ce critère évaluait la fidélité avec laquelle la sortie TTS imitait la parole humaine en termes de ton, de tempo et d'intonation.
• Ponctuation : la capacité du service TTS à interpréter et à appliquer correctement le rythme et les pauses requis par les signes de ponctuation dans le texte a également été testée.
• Exhaustivité : nous avons vérifié si la sortie vocale était claire et parfaitement compréhensible, transmettant ainsi efficacement l'information souhaitée.
• Mean Opinion Score (MOS) : la qualité des sorties TTS a été évaluée à l'aide du Mean Opinion Score, une mesure subjective de qualité couramment utilisée en traitement audio. Reconnaissant la nature subjective de cette évaluation, les appréciations étaient fondées sur des perceptions individuelles et moyennées afin d'obtenir une note globale pour chaque sortie TTS.
SOLUTIONS TESTÉES
Notre étude sur les services de synthèse vocale (TTS) pour le Secteur bancaire polonais poursuivi avec les fournisseurs précédemment sélectionnés pour les tests de reconnaissance vocale (STT) : Microsoft Azure et Google Cloud Platform (GCP). Ces plateformes ont été choisies en raison de leur utilisation répandue et de leur prise en charge robuste de la langue polonaise, promettant une parole de haute qualité et au son naturel, essentielle pour les applications de service client. Il est important de noter que nous avons dû exclure OpenAI Whisper hébergé sur AWS du test TTS, car il s'agit exclusivement d'un modèle STT et il n'offre pas de capacités TTS.
Notre approche a consisté à sélectionner trois voix populaires chez chaque fournisseur, afin de garantir une analyse large et comparative entre ces plateformes. Pour Azure, nous avons choisi d'inclure toutes les voix neuronales polonaises prises en charge, car seules trois étaient disponibles. À l'inverse, GCP propose une gamme plus étendue de voix polonaises, avec environ 10 options. Pour maintenir un périmètre équilibré et gérable pour notre étude, nous n'avons sélectionné que trois de ces voix, en cohérence avec le nombre testé chez Azure.
Les voix choisies étaient :
Microsoft Azure :
- pl-PL-AgnieszkaNeural
- pl-PL-MarekNeural
- pl-PL-ZofiaNeural
Google Cloud Platform (GCP) :
- pl-PL-Standard-B
- pl-PL-Wavenet-B
- pl-PL-Wavenet-C
SETUP
Évaluateurs
L'équipe d'évaluation était composée de deux personnes dont le polonais est la langue maternelle. Leur rôle était essentiel au processus d'évaluation, car elles ont apporté un regard expert sur le naturel, la précision et l'exhaustivité des résultats de la synthèse vocale.
Processus d'évaluation
Les évaluateurs ont analysé les fichiers audio générés par la synthèse vocale, en se concentrant sur les métriques de naturel, de précision et d'exhaustivité, afin de déterminer avec quelle efficacité chaque service imitait la parole humaine.
Échelle d'évaluation
Les évaluateurs ont utilisé une échelle de notation de 1 à 5 pour chaque métrique, 1 étant la note la plus basse et 5 la plus élevée. Cette échelle a fourni une mesure quantitative des performances de chaque service TTS, permettant un processus d'évaluation structuré et cohérent.
Résultats
L'évaluation complète des services de synthèse vocale a permis de tirer des conclusions éclairantes sur leurs performances dans le contexte du domaine bancaire polonais. Les résultats suivants mettent en évidence les capacités variées selon les différentes métriques, suggérant que le choix d'un service de TTS devrait être spécifique à la voix plutôt que fondé uniquement sur le fournisseur cloud.

Tableau 1 – Comparaison des Voices – tableau évaluant la naturalité, la ponctuation, l'exhaustivité, la moyenne.
NATUREL
Les résultats indiquent que Azure pl-PL-AgnieszkaNeural(4.04 +-0.45), GCP’s pl-PL-Wavenet-B(4.00 +-0.75), et Azure pl-PL-MarekNeural(3.92 +-0.74) ont été les meilleurs performeurs dans l'évaluation de la naturalité, avec des différences mineures dans leurs scores moyens.
Ces voix ont mené le classement, ce qui suggère qu'elles offrent la synthèse vocale la plus naturelle, imitant étroitement les caractéristiques de la voix humaine. En revanche, les autres voix ont montré une baisse de la naturalité perçue, avec une performance nettement inférieure de Azure pl-PL-ZofiaNeural(2.38+-0.80), qui était à la traîne alors qu'Azure disposait de deux voix dans la catégorie haut de gamme. Cela indique une variabilité de la qualité au sein d'un même fournisseur, Azure proposant à la fois l'une des voix TTS les plus naturelles et l'une des moins naturelles de cette évaluation.
PONCTUATION
Azure’s pl-PL-MarekNeural a excellé en ponctuation avec un score moyen de 4,62 et l'écart-type le plus faible, indiquant une performance hautement précise et stable ainsi qu'un accord élevé entre les annotateurs. Le meilleur de GCP, pl-PL-Wavenet-B, a obtenu un score respectable de 4,19, démontrant une compétence mais avec une variance plus large entre les échantillons.
EXHAUSTIVITÉ
Les voix Azure et GCP ont toutes deux obtenu des scores de compréhension parfaits ou quasi parfaits de 5,00, ce qui dénote une articulation parfaitement claire et une transmission réussie du message. Cela signifie que, globalement, les informations du message sont correctement transmises à l'auditeur.
Conclusions
Il est temps de résumer l'ensemble de l'expérience. Dans l'évaluation des services de discours public pour le secteur bancaire polonais, Google Cloud Platform (GCP) et Microsoft Azure apparaissent tous deux comme des concurrents solides, offrant des capacités robustes et efficaces de synthèse vocale et de reconnaissance vocale.
Pour les applications de synthèse vocale, il est crucial de prendre en compte la variabilité de la performance vocale au sein d'une même plateforme, ce qui souligne la nécessité d'une sélection minutieuse. Bien que la tarification de GCP et d'Azure soit comparable, le choix de la plateforme doit être fondé sur les capacités d'intégration spécifiques et l'infrastructure cloud existante de l'organisation bancaire.
Il convient également de mentionner la performance demodèle Whisper d'OpenAI dans le domaine des services de reconnaissance vocale, en particulier dans les scénarios présentant un bruit de fond important. Notre évaluation a mis en évidence que Whisper excelle dans les environnements avec un audio très bruyant, démontrant un haut degré de résilience et de précision. Cela en fait une option précieuse pour les applications du secteur bancaire où un audio clair n'est pas toujours disponible, comme dans les interactions de service client par téléphone.
Cependant, il est important de rappeler que les conclusions tirées de cette recherche pourraient rapidement devenir obsolètes. La nature de « boîte noire » des fournisseurs de services cloud, y compris la capacité de mettre à jour les poids des modèles sans notification préalable, signifie que les performances de ces services peuvent évoluer de manière imprévisible.
Ce facteur souligne la nécessité d'une surveillance et d'une réévaluation continues de ces technologies afin de garantir qu'elles répondent en permanence aux besoins opérationnels et aux normes du secteur bancaire. L'adoption de ces services doit se faire en comprenant leur nature évolutive et en mettant en place des stratégies pour s'adapter aux changements et améliorations potentiels de leurs offres.
étude de cas du voicebot IA
Cet article portait principalement sur l'expérimentation, mais notre équipe possède également de l'expérience dans la mise en œuvre de solutions de voicebot dans des conditions réelles. Pour l'un de nos clients, une institution financière polonaise de premier plan, nous avons développé un voicebot IA entièrement fonctionnel parlant polonais à partir de BoostAI. Il agit comme un intermédiaire avant de mettre un client en relation avec un consultant approprié du côté d'Amazon Connect.
Souhaitez-vous en savoir plus sur ce projet ? Nous vous invitons à lire cette étude de cas : Une intégration puissante pour transformer le service client dans la banque polonaise.
Et si vous souhaitez que nous concevions quelque chose de similaire pour votre entreprise, notre équipe est à votre service. Découvrez notre offering et contactez-nous pour discuter de vos besoins.
La synthèse vocale (TTS) convertit un texte écrit en audio parlé. Dans le secteur bancaire, elle prend en charge les voicebots, l'automatisation du service client, les fonctionnalités d'accessibilité et les interactions téléphoniques où une communication claire et naturelle est essentielle.
Microsoft Azure et Google Cloud Platform offrent tous deux de solides capacités de synthèse vocale pour le polonais. Les résultats montrent que les performances varient selon la voix plutôt que selon le fournisseur ; il est donc plus important de sélectionner le bon modèle de voix que de choisir une plateforme en soi.
Le naturel dépend du ton, du rythme et de l'intonation. Les voix TTS de haute qualité imitent les schémas de la parole humaine, y compris les pauses et les accentuations appropriées, rendant les interactions plus engageantes et plus faciles à comprendre.
La qualité de la TTS est généralement évaluée à l'aide de métriques telles que le naturel, la gestion de la ponctuation et la compréhensibilité. Le Mean Opinion Score (MOS), basé sur l'évaluation humaine, est couramment utilisé pour mesurer la qualité audio globale.
Oui, les solutions TTS modernes offrent une grande compréhensibilité et une grande clarté, ce qui les rend adaptées à une utilisation en contact avec la clientèle. Cependant, les performances peuvent varier selon les voix et évoluer dans le temps, il est donc recommandé de procéder à des évaluations régulières.