语音合成标记语言(SSML)是一种基于 XML 的标记语言,可用于微调文本到语音输出属性,如音调、发音、说话速率、音量等。 它提供比纯文本输入更多的控制和灵活性。
Tip
可以使用 语音库以不同的样式和音调听到阅读示例文本的声音。
用例场景
SSML 旨在让你能够灵活控制语音输出的效果,并提供了多种属性来自定义这种输出。 您可以使用 SSML 来:
- 定义用于确定文本到语音输出的结构、内容和其他特征的输入文本结构。 例如,可以使用 SSML 来定义段落、句子、中断/暂停或静音。 可以使用事件标记(如书签或 viseme)来包装文本,应用程序稍后可以处理这些标记。 Viseme 是语音语音(单个语音)的视觉描述,以口语形式显示。
- 选择语音、语言、名称、样式和角色。 可以在单个 SSML 文档中使用多个语音。 还可以调整强调、说话率、音调和音量。 SSML 还可以插入预录制的音频,例如声音效果或音乐音符。
- 控制 输出音频的发音。 例如,可以将 SSML 与音素和自定义词典一起使用,以提高发音。 还可以使用 SSML 定义单词或数学表达式的具体发音。
使用 SSML 的方法
SSML 功能在可能适合你的用例的各种工具中可用。
Important
系统会按照转换为语音的每个字符向您收费,包括标点符号。 尽管 SSML 文档本身不计费,但服务会将您用于调整文本转换为语音方式的可选元素(如音素和音高)计为可计费字符。 有关详细信息,请参阅 定价说明。
可以通过以下方式使用 SSML:
- 音频内容创建 工具允许你在 Speech Studio 中创作纯文本和 SSML。 可以收听输出音频并调整 SSML 以提高语音合成。 有关详细信息,请参阅 语音合成与音频内容创建工具。
-
语音 CLI 通过
spx synthesize --ssml SSML命令行参数接受 SSML。 - 语音 SDK 在不同受支持的语言中均可通过“speak”SSML 方法接受 SSML。