语音合成标记语言 (SSML) 概述

语音合成标记语言(SSML)是一种基于 XML 的标记语言,可用于微调文本到语音输出属性,如音调、发音、说话速率、音量等。 它提供比纯文本输入更多的控制和灵活性。

Tip

可以使用 语音库以不同的样式和音调听到阅读示例文本的声音。

用例场景

SSML 旨在让你能够灵活控制语音输出的效果,并提供了多种属性来自定义这种输出。 您可以使用 SSML 来:

  • 定义用于确定文本到语音输出的结构、内容和其他特征的输入文本结构。 例如,可以使用 SSML 来定义段落、句子、中断/暂停或静音。 可以使用事件标记(如书签或 viseme)来包装文本,应用程序稍后可以处理这些标记。 Viseme 是语音语音(单个语音)的视觉描述,以口语形式显示。
  • 选择语音、语言、名称、样式和角色。 可以在单个 SSML 文档中使用多个语音。 还可以调整强调、说话率、音调和音量。 SSML 还可以插入预录制的音频,例如声音效果或音乐音符。
  • 控制 输出音频的发音。 例如,可以将 SSML 与音素和自定义词典一起使用,以提高发音。 还可以使用 SSML 定义单词或数学表达式的具体发音。

使用 SSML 的方法

SSML 功能在可能适合你的用例的各种工具中可用。

Important

系统会按照转换为语音的每个字符向您收费,包括标点符号。 尽管 SSML 文档本身不计费,但服务会将您用于调整文本转换为语音方式的可选元素(如音素和音高)计为可计费字符。 有关详细信息,请参阅 定价说明

可以通过以下方式使用 SSML:

  • 音频内容创建 工具允许你在 Speech Studio 中创作纯文本和 SSML。 可以收听输出音频并调整 SSML 以提高语音合成。 有关详细信息,请参阅 语音合成与音频内容创建工具
  • 语音 CLI 通过 spx synthesize --ssml SSML 命令行参数接受 SSML。
  • 语音 SDK 在不同受支持的语言中均可通过“speak”SSML 方法接受 SSML。

后续步骤