SIP CallerSIP Caller
Índice
    Visão Geral
    Principais Comandos SSML
    <speak>
    <break>
    <emphasis>
    <prosody>
    <say-as>
    <sub>
    <p> e <s>
    Dicas Rápidas
    Observação Especial ao Usar SSML com Azure Text-to-Speech

Visão Geral

SSML (Speech Synthesis Markup Language) permite controlar como o texto é lido em voz alta. Isso possibilita ajustar a pronúncia, o tom, a ênfase e muito mais para criar mensagens de voz naturais e envolventes. Abaixo estão os comandos SSML mais úteis que você pode usar com o SIP Caller para personalizar sua experiência de conversão de texto em fala.

Principais Comandos SSML

<speak>

  • Finalidade: O elemento raiz de todo SSML, garantindo que sua mensagem seja processada como SSML.
  • Exemplo:
    <speak>Hello! How can I help you today?</speak>

<break>

  • Finalidade: Adiciona uma pausa na fala. Use isso para criar um fluxo de conversa natural.
  • Atributos:
    • time: Duração da pausa (por exemplo, "500ms" para milissegundos ou "1s" para segundos).
  • Exemplo:
    <speak>Hello! <break time="500ms"/> How can I assist you?</speak>

<emphasis>

  • Finalidade: Altera a ênfase em palavras específicas para adicionar expressividade.
  • Atributos:
    • level: Pode ser "strong", "moderate" ou "reduced".
  • Exemplo:
    <speak>This is <emphasis level="strong">very important</emphasis> information.</speak>

<prosody>

  • Finalidade: Controla o tom, a velocidade e o volume do texto falado.
  • Atributos:
    • rate: Velocidade da fala (por exemplo, "fast", "slow", ou porcentagens).
    • pitch: Tom da voz (por exemplo, "high", "low", ou "+10%").
    • volume: Nível de volume (por exemplo, "loud", "soft").
  • Exemplo:
    <speak><prosody rate="slow" pitch="low">Please listen carefully.</prosody></speak>

<say-as>

  • Finalidade: Especifica o tipo de conteúdo para ajudar na pronúncia (por exemplo, datas, horas, endereços).
  • Atributos:
    • interpret-as: Pode ser definido como "date", "time", "characters", "expletive", etc.
  • Exemplo:
    <speak>The date is <say-as interpret-as="date">2024-11-08</say-as>.</speak>

<sub>

  • Finalidade: Lê uma abreviação ou sigla por sua forma completa.
  • Atributos:
    • alias: O texto completo a ser lido.
  • Exemplo:
    <speak>SIP Caller uses <sub alias="Session Initiation Protocol">SIP</sub> to connect to the PBX.</speak>

<p> e <s>

  • Finalidade: Define parágrafos (<p>) e frases (<s>) para estruturar mensagens mais longas e obter um melhor ritmo.
  • Exemplo:
    <speak><p>Welcome to SIP Caller.</p><p>How can we assist you today?</p></speak>

Dicas Rápidas

  • Teste Variações: Experimente combinações de <break>, <emphasis> e <prosody> para encontrar as mensagens com som mais natural.
  • Mantenha a Clareza: O uso excessivo de SSML pode fazer as mensagens soarem robóticas. Concentre-se na clareza e na fluidez.
  • Acessibilidade: Use <say-as> para datas, horas e pronúncias especiais para garantir a precisão.

Ao usar o SSML de forma eficaz no SIP Caller, você pode entregar mensagens de voz claras, profissionais e envolventes que melhoram as interações com os clientes. Para mais personalização, sinta-se à vontade para explorar a especificação completa de SSML do Google ou a especificação de SSML da Azure e experimentar diferentes configurações com o recurso de conversão de texto em fala do SIP Caller.

Observação Especial ao Usar SSML com Azure Text-to-Speech

Ao usar SSML com o Azure Text-to-Speech, observe que o Azure é muito rigoroso quanto à estrutura das tags SSML, especialmente quando comparado ao Google Cloud Text-to-Speech, que é mais permissivo.

Para que o Azure TTS funcione corretamente no SIP Caller, você deve incluir explicitamente tanto o elemento raiz <speak> quanto um elemento <voice> na sua entrada SSML.

Além disso, o elemento <voice> deve especificar exatamente a mesma voz que está selecionada para a campanha no SIP Caller. Se a voz definida no SSML não corresponder à voz da campanha, o Azure pode rejeitar a solicitação e falhar ao sintetizar o áudio.

Não seguir essa estrutura pode resultar em erros de síntese e o áudio pode não ser gerado.

Exemplo:

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US"> <voice name="en-US-AvaNeural"> Hello. <break time="1s"/> This is a call from ACME. <break time="1s"/> This is to confirm your appointment tomorrow. <break time="1s"/> If there are any issues with this visit, please contact us. Thank you. </voice> </speak>


SIP Caller
© 2026 Easy Caller LLC Todos os direitos reservados
LinkedinYou Tube
Trustpilot