Table des Matières
    Vue d’ensemble
    Commandes SSML Clés
    <speak>
    <break>
    <emphasis>
    <prosody>
    <say-as>
    <sub>
    <p> et <s>
    Astuces Rapides
    Remarque Spéciale Concernant l’Utilisation de SSML avec Azure Text-to-Speech

Vue d’ensemble

SSML (Speech Synthesis Markup Language) vous permet de contrôler la manière dont le texte est lu à voix haute. Il vous permet d’affiner la prononciation, le ton, l’emphase et bien plus encore, afin de créer des invites vocales naturelles et engageantes. Vous trouverez ci-dessous les commandes SSML les plus utiles que vous pouvez utiliser avec SIP Caller pour personnaliser votre expérience de synthèse vocale.

Commandes SSML Clés

<speak>

  • Objectif : L’élément racine pour tout SSML, garantissant que votre invite est traitée comme du SSML.
  • Exemple :
    <speak>Bonjour ! Comment puis-je vous aider aujourd’hui ?</speak>

<break>

  • Objectif : Ajoute une pause dans la parole. Utilisez ceci pour créer un flux conversationnel naturel.
  • Attributs :
    • time : Durée de la pause (par exemple, « 500ms » pour des millisecondes ou « 1s » pour des secondes).
  • Exemple :
    <speak>Bonjour ! <break time="500ms"/> Comment puis-je vous aider ?</speak>

<emphasis>

  • Objectif : Modifie l’emphase sur des mots spécifiques pour ajouter de l’expression.
  • Attributs :
    • level : Peut être « strong », « moderate », ou « reduced ».
  • Exemple :
    <speak>Ceci est une information <emphasis level="strong">très importante</emphasis>.</speak>

<prosody>

  • Objectif : Contrôle la hauteur, le débit et le volume du texte parlé.
  • Attributs :
    • rate : Vitesse de la parole (par exemple, « fast », « slow », ou des pourcentages).
    • pitch : Hauteur de la voix (par exemple, « high », « low », ou « +10% »).
    • volume : Niveau du volume (par exemple, « loud », « soft »).
  • Exemple :
    <speak><prosody rate="slow" pitch="low">Veuillez écouter attentivement.</prosody></speak>

<say-as>

  • Objectif : Spécifie le type de contenu pour faciliter la prononciation (par exemple, dates, heures, adresses).
  • Attributs :
    • interpret-as : Peut être défini sur « date », « time », « characters », « expletive », etc.
  • Exemple :
    <speak>La date est le <say-as interpret-as="date">2024-11-08</say-as>.</speak>

<sub>

  • Objectif : Lit une abréviation ou un acronyme sous sa forme complète.
  • Attributs :
    • alias : Le texte complet à lire.
  • Exemple :
    <speak>SIP Caller utilise <sub alias="Session Initiation Protocol">SIP</sub> pour se connecter au PBX.</speak>

<p> et <s>

  • Objectif : Définit des paragraphes (<p>) et des phrases (<s>) pour structurer des invites plus longues afin d’obtenir un meilleur rythme.
  • Exemple :
    <speak><p>Bienvenue chez SIP Caller.</p><p>Comment pouvons-nous vous aider aujourd’hui ?</p></speak>

Astuces Rapides

  • Testez des variations : Essayez des combinaisons de <break>, <emphasis>, et <prosody> pour trouver les invites qui sonnent le plus naturellement.
  • Restez clair : Une utilisation excessive de SSML peut rendre les invites robotiques. Concentrez-vous sur la clarté et la fluidité.
  • Accessibilité : Utilisez <say-as> pour les dates, les heures et les prononciations spéciales afin de garantir la précision.

En utilisant SSML efficacement dans SIP Caller, vous pouvez proposer des invites vocales claires, professionnelles et engageantes qui améliorent les interactions avec vos clients. Pour une personnalisation plus poussée, n’hésitez pas à explorer la spécification SSML complète de Google ou la spécification SSML d’Azure et à essayer différentes configurations avec la fonctionnalité de synthèse vocale de SIP Caller.

Remarque Spéciale Concernant l’Utilisation de SSML avec Azure Text-to-Speech

Lorsque vous utilisez SSML avec Azure Text-to-Speech, veuillez noter qu’Azure est très strict concernant la structure des balises SSML, surtout par rapport à Google Cloud Text-to-Speech, qui est plus permissif.

Pour que le TTS Azure fonctionne correctement dans SIP Caller, vous devez inclure explicitement à la fois l’élément racine <speak> et un élément <voice> dans votre saisie SSML.

De plus, l’élément <voice> doit spécifier exactement la même voix que celle sélectionnée pour la campagne dans SIP Caller. Si la voix définie dans le SSML ne correspond pas à la voix de la campagne, Azure peut rejeter la requête et échouer à synthétiser l’audio.

Le non-respect de cette structure peut entraîner des erreurs de synthèse et l’absence totale de génération audio.

Exemple :

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="fr-FR"> <voice name="fr-FR-DeniseNeural"> Bonjour. <break time="1s"/> Ceci est un appel de ACME. <break time="1s"/> Ceci est pour confirmer votre rendez-vous de demain. <break time="1s"/> Si vous rencontrez un problème avec cette visite, veuillez nous contacter. Merci. </voice> </speak>


SIP Caller
© 2026 Easy Caller LLC Tous droits réservés
LinkedinYou Tube
Trustpilot