SSML (Speech Synthesis Markup Language) vous permet de contrôler la manière dont le texte est lu à voix haute. Il vous permet d’affiner la prononciation, le ton, l’emphase et bien plus encore, afin de créer des invites vocales naturelles et engageantes. Vous trouverez ci-dessous les commandes SSML les plus utiles que vous pouvez utiliser avec SIP Caller pour personnaliser votre expérience de synthèse vocale.
<speak>Bonjour ! Comment puis-je vous aider aujourd’hui ?</speak>
<speak>Bonjour ! <break time="500ms"/> Comment puis-je vous aider ?</speak>
<speak>Ceci est une information <emphasis level="strong">très importante</emphasis>.</speak>
<speak><prosody rate="slow" pitch="low">Veuillez écouter attentivement.</prosody></speak>
<speak>La date est le <say-as interpret-as="date">2024-11-08</say-as>.</speak>
<speak>SIP Caller utilise <sub alias="Session Initiation Protocol">SIP</sub> pour se connecter au PBX.</speak>
<speak><p>Bienvenue chez SIP Caller.</p><p>Comment pouvons-nous vous aider aujourd’hui ?</p></speak>
En utilisant SSML efficacement dans SIP Caller, vous pouvez proposer des invites vocales claires, professionnelles et engageantes qui améliorent les interactions avec vos clients. Pour une personnalisation plus poussée, n’hésitez pas à explorer la spécification SSML complète de Google ou la spécification SSML d’Azure et à essayer différentes configurations avec la fonctionnalité de synthèse vocale de SIP Caller.
Lorsque vous utilisez SSML avec Azure Text-to-Speech, veuillez noter qu’Azure est très strict concernant la structure des balises SSML, surtout par rapport à Google Cloud Text-to-Speech, qui est plus permissif.
Pour que le TTS Azure fonctionne correctement dans SIP Caller, vous devez inclure explicitement à la fois l’élément racine <speak> et un élément <voice> dans votre saisie SSML.
De plus, l’élément <voice> doit spécifier exactement la même voix que celle sélectionnée pour la campagne dans SIP Caller. Si la voix définie dans le SSML ne correspond pas à la voix de la campagne, Azure peut rejeter la requête et échouer à synthétiser l’audio.
Le non-respect de cette structure peut entraîner des erreurs de synthèse et l’absence totale de génération audio.
Exemple :
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="fr-FR"> <voice name="fr-FR-DeniseNeural"> Bonjour. <break time="1s"/> Ceci est un appel de ACME. <break time="1s"/> Ceci est pour confirmer votre rendez-vous de demain. <break time="1s"/> Si vous rencontrez un problème avec cette visite, veuillez nous contacter. Merci. </voice> </speak>