SSML (Speech Synthesis Markup Language) pozwala kontrolować sposób, w jaki tekst jest czytany na głos. Umożliwia precyzyjne dostrojenie wymowy, tonu, akcentowania i innych elementów, aby tworzyć naturalne i angażujące monity głosowe. Poniżej znajdują się najbardziej przydatne polecenia SSML, których możesz używać w SIP Caller, aby dostosować sposób działania zamiany tekstu na mowę.
<speak>Cześć! Jak mogę Ci dziś pomóc?</speak>
<speak>Cześć! <break time="500ms"/> Jak mogę Ci pomóc?</speak>
<speak>To jest <emphasis level="strong">bardzo ważna</emphasis> informacja.</speak>
<speak><prosody rate="slow" pitch="low">Proszę słuchać uważnie.</prosody></speak>
<speak>Data to <say-as interpret-as="date">2024-11-08</say-as>.</speak>
<speak>SIP Caller używa <sub alias="Session Initiation Protocol">SIP</sub>, aby połączyć się z centralą PBX.</speak>
<speak><p>Witamy w SIP Caller.</p><p>Jak możemy Ci dziś pomóc?</p></speak>
Efektywnie korzystając z SSML w SIP Caller, możesz dostarczać przejrzyste, profesjonalne i angażujące monity głosowe, które usprawniają interakcje z klientami. Aby uzyskać dalsze możliwości dostosowywania, zapoznaj się z pełną specyfikacją SSML dla Google lub specyfikacją SSML dla Azure i wypróbuj różne konfiguracje z funkcją zamiany tekstu na mowę w SIP Caller.
Korzystając z SSML z Azure Text-to-Speech, pamiętaj, że Azure jest bardzo rygorystyczny co do struktury tagów SSML, zwłaszcza w porównaniu z Google Cloud Text-to-Speech, który jest bardziej elastyczny.
Aby Azure TTS działał poprawnie w SIP Caller, musisz jawnie uwzględnić zarówno element główny <speak>, jak i element <voice> w swoim wejściu SSML.
Dodatkowo element <voice> musi określać dokładnie ten sam głos, który jest wybrany dla kampanii w SIP Caller. Jeśli głos zdefiniowany w SSML nie zgadza się z głosem kampanii, Azure może odrzucić żądanie i nie zsyntetyzować dźwięku.
Niezastosowanie się do tej struktury może skutkować błędami syntezy i całkowitym brakiem wygenerowania dźwięku.
Przykład:
<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="en-US"> <voice name="en-US-AvaNeural"> Dzień dobry. <break time="1s"/> Dzwonimy z firmy ACME. <break time="1s"/> Chcemy potwierdzić Twoją wizytę jutro. <break time="1s"/> Jeśli pojawią się jakiekolwiek problemy z tą wizytą, prosimy o kontakt. Dziękujemy. </voice> </speak>