Sommario
    Panoramica
    Comandi SSML Principali
    <speak>
    <break>
    <emphasis>
    <prosody>
    <say-as>
    <sub>
    <p> e <s>
    Consigli Rapidi
    Nota Speciale sull'Utilizzo di SSML con Azure Text-to-Speech

Panoramica

SSML (Speech Synthesis Markup Language) ti permette di controllare come il testo viene letto ad alta voce. Ti consente di ottimizzare la pronuncia, il tono, l'enfasi e altro ancora, per creare messaggi vocali naturali e coinvolgenti. Di seguito sono riportati i comandi SSML più utili che puoi usare con SIP Caller per personalizzare la tua esperienza di sintesi vocale (Text-to-Speech).

Comandi SSML Principali

<speak>

  • Scopo: L'elemento radice per tutto l'SSML, che garantisce che il tuo messaggio venga elaborato come SSML.
  • Esempio:
    <speak>Salve! Come posso aiutarla oggi?</speak>

<break>

  • Scopo: Aggiunge una pausa nel discorso. Usalo per creare un flusso conversazionale naturale.
  • Attributi:
    • time: Durata della pausa (es., "500ms" per millisecondi o "1s" per secondi).
  • Esempio:
    <speak>Salve! <break time="500ms"/> Come posso assisterla?</speak>

<emphasis>

  • Scopo: Modifica l'enfasi su parole specifiche per aggiungere espressività.
  • Attributi:
    • level: Può essere "strong," "moderate," o "reduced."
  • Esempio:
    <speak>Questa è un'informazione <emphasis level="strong">molto importante</emphasis>.</speak>

<prosody>

  • Scopo: Controlla il tono, la velocità e il volume del testo pronunciato.
  • Attributi:
    • rate: Velocità del discorso (es., "fast," "slow," o percentuali).
    • pitch: Tono della voce (es., "high," "low," o "+10%").
    • volume: Livello del volume (es., "loud," "soft").
  • Esempio:
    <speak><prosody rate="slow" pitch="low">La preghiamo di ascoltare attentamente.</prosody></speak>

<say-as>

  • Scopo: Specifica il tipo di contenuto per aiutare con la pronuncia (es., date, orari, indirizzi).
  • Attributi:
    • interpret-as: Può essere impostato su "date", "time", "characters", "expletive", ecc.
  • Esempio:
    <speak>La data è <say-as interpret-as="date">2024-11-08</say-as>.</speak>

<sub>

  • Scopo: Legge un'abbreviazione o un acronimo nella sua forma di parola completa.
  • Attributi:
    • alias: Il testo completo da leggere.
  • Esempio:
    <speak>SIP Caller utilizza <sub alias="Session Initiation Protocol">SIP</sub> per connettersi al PBX.</speak>

<p> e <s>

  • Scopo: Definisce paragrafi (<p>) e frasi (<s>) per strutturare messaggi più lunghi e ottenere un ritmo migliore.
  • Esempio:
    <speak><p>Benvenuto in SIP Caller.</p><p>Come possiamo assisterla oggi?</p></speak>

Consigli Rapidi

  • Testa Variazioni: Sperimenta combinazioni di <break>, <emphasis> e <prosody> per trovare i messaggi dal suono più naturale.
  • Mantieni la Chiarezza: Un uso eccessivo dell'SSML può far suonare i messaggi in modo robotico. Concentrati sulla chiarezza e sulla fluidità.
  • Accessibilità: Usa <say-as> per date, orari e pronunce speciali per garantire l'accuratezza.

Utilizzando SSML in modo efficace in SIP Caller, puoi offrire messaggi vocali chiari, professionali e coinvolgenti che migliorano le interazioni con i clienti. Per ulteriori personalizzazioni, non esitare a esplorare la specifica SSML completa per Google o la specifica SSML per Azure e a provare diverse configurazioni con la funzionalità di sintesi vocale (Text-to-Speech) di SIP Caller.

Nota Speciale sull'Utilizzo di SSML con Azure Text-to-Speech

Quando utilizzi SSML con Azure Text-to-Speech, tieni presente che Azure è molto rigoroso riguardo alla struttura dei tag SSML, specialmente rispetto a Google Cloud Text-to-Speech, che è più permissivo.

Affinché Azure TTS funzioni correttamente in SIP Caller, devi includere esplicitamente sia l'elemento radice <speak> sia un elemento <voice> nel tuo input SSML.

Inoltre, l'elemento <voice> deve specificare esattamente la stessa voce selezionata per la campagna in SIP Caller. Se la voce definita nell'SSML non corrisponde alla voce della campagna, Azure potrebbe rifiutare la richiesta e non riuscire a sintetizzare l'audio.

Il mancato rispetto di questa struttura può causare errori di sintesi e la mancata generazione dell'audio.

Esempio:

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US"> <voice name="en-US-AvaNeural"> Salve. <break time="1s"/> Questa è una chiamata da ACME. <break time="1s"/> Questo per confermare il suo appuntamento di domani. <break time="1s"/> Se ci sono problemi con questa visita, la preghiamo di contattarci. Grazie. </voice> </speak>


SIP Caller
© 2026 Easy Caller LLC Tutti i diritti riservati
LinkedinYou Tube
Trustpilot