# AI 文本转语音使用教程：5 种音色 + 7 种情感，文字一键变自然配音

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/ai-text-to-speech-guide

## 工具简介

**AI 文本转语音**是工具派推出的一款在线语音合成工具：把文字粘贴进输入框，选好发音人、语速、音调和情感风格，点击「开始合成」，AI 就能生成一段自然流畅的中文语音，并提供在线试听和音频下载。它内置 5 种中文发音人、7 种情感风格，支持 MP3 / WAV 两种输出格式，还能上传一段背景音乐自动混入配音，甚至可以通过简单标签实现多人对话式的多角色配音，适合做视频旁白、有声读物、课件讲解和短视频配音。

## 参数说明

| 参数 | 说明 | 默认值 / 取值范围 |
| --- | --- | --- |
| 文本内容 | 要转换成语音的文字，输入框右下角实时显示字数 | 必填，最多 1000 字 |
| 发音人 | 合成语音的音色，含 3 个女声、2 个男声 | 小云（女声，默认）、小刚（男声）、小美（女声）、小莉（女声）、小明（男声） |
| 输出格式 | 生成音频的文件格式 | MP3（默认）或 WAV |
| 语速 | 朗读快慢，负值变慢、正值变快 | 默认 0，范围 -50 ~ +50 |
| 音调 | 声音高低，负值低沉、正值尖细 | 默认 0，范围 -50 ~ +50 |
| 情感/风格 | 朗读的情绪与场景风格 | 标准（默认）、温柔、激昂、新闻、客服、纪录片、耳语 |
| 背景音乐（可选） | 上传一个音频文件作为配音背景，合成时自动混入 | 支持常见音频格式，不填则不混入 |
| 背景音乐音量 | 上传背景音乐后才出现的滑杆，控制背景音乐的音量比例 | 默认 30%，范围 0 ~ 100% |

另外，在文本中插入 `<男声>` / `<女声>` / `<speaker1>` 这类标签，可以让不同段落使用不同角色朗读，实现多角色配音；系统检测到标签后会自动按多角色模式合成。

## 使用步骤

1. **打开工具页面**：页面上方是工具名称和简介，下方白色卡片就是操作区，所有参数都在一个卡片内完成，无需安装任何软件。

![AI 文本转语音工具主界面：上方为文本输入框（最多 1000 字），下方依次为发音人、输出格式、语速、音调、情感/风格、](article/202607/1783969304050_8025.png)

2. **输入文本内容**：在「文本内容」输入框中粘贴或输入要转换的文字，最多 1000 字，右下角会实时显示「当前字数 / 1000」。如果文本为空，点击合成时会提示「请输入需要合成的文本」；超过 1000 字则提示超长，需要分段处理。

3. **选择发音人与输出格式**：在「发音人」下拉中选择音色——小云、小美、小莉是女声，小刚、小明是男声；在「输出格式」下拉中选择 MP3（体积小、通用）或 WAV（无损、适合二次剪辑）。

4. **调节语速、音调与情感风格**：拖动「语速」「音调」滑杆微调朗读效果，默认 0 表示标准状态，滑杆上方会实时显示当前数值（如「语速 +10」）；在「情感/风格」下拉中选择朗读情绪，比如做新闻播报选「新闻」、讲故事选「温柔」、做促销配音选「激昂」。

5. **（可选）添加背景音乐**：点击「背景音乐（可选）」的「选择文件」上传一段音频，上传成功后会显示文件名和大小，并额外出现一个「背景音乐音量」滑杆，默认 30%，按需拖动调整，避免背景音乐盖过人声。

6. **点击「开始合成」并等待结果**：填写完成后点击底部蓝色「开始合成」按钮，按钮会变为「合成中...」。合成完成后页面下方出现「播放与下载」区域：可以先用播放器在线试听，满意后点击「下载音频」保存到本地，文件名形如 `tts_时间戳.mp3`。

## 使用技巧

- **多角色对话配音**：在文本里用 `<男声>` 和 `<女声>` 标签分隔不同角色的台词，例如「`<女声>`你好，请问需要什么帮助？`<男声>`我想了解一下会员权益。」，系统会自动识别并按多角色模式合成，适合做对话式短视频和有声剧。
- **语速音调小幅度调整更自然**：语速和音调在 ±10 以内调整时听感最自然，数值拉得太极端（如 ±50）会出现明显的加速失真或变声感，建议边试听边微调。
- **情感风格要和内容匹配**：「新闻」风格字正腔圆、节奏平稳，适合资讯播报；「纪录片」低沉舒缓，适合解说词；「耳语」音量轻、气息感强，适合助眠和悬疑氛围。
- **背景音乐音量宁低勿高**：人声是主体时，背景音乐音量建议保持在 30% 以下，否则会喧宾夺主；上传前最好先把背景音乐裁剪成与文本朗读时长接近的长度。
- **长文本分段合成**：单次最多 1000 字，长篇稿件可以按段落拆成多次合成，再把音频文件按顺序拼接，效果比硬塞进一段更稳定。
- **要二次剪辑就选 WAV**：如果合成后还要进剪辑软件做降噪、混音，优先选 WAV 格式，避免 MP3 二次压缩带来的音质损失。

## 常见问题

**Q1：合成的语音可以试听吗？**
可以。合成成功后页面下方会出现「播放与下载」区域，内置播放器可以直接在线试听，确认满意后再点「下载音频」保存，不满意就调参数重新合成。

**Q2：文本里的 `<男声>` `<女声>` 标签是什么意思？**
这是多角色配音标记。在文本中用这些标签包住不同角色的台词，系统检测到标签后会自动切换为多角色合成模式，让不同段落用不同音色朗读，适合做对话类内容。不需要多角色时直接写普通文本即可。

**Q3：MP3 和 WAV 怎么选？**
MP3 体积小、兼容性好，直接用于视频配音、公众号语音等场景选它即可；WAV 是无损格式，文件更大，适合还要进专业剪辑软件二次处理的情况。

**Q4：上传的背景音乐有什么要求？**
支持常见音频格式，上传后卡片下方会显示文件名和大小，并出现音量调节滑杆（默认 30%）。建议选用纯音乐、无歌词的素材，并提前裁剪到与朗读时长相近的长度。

**Q5：点击合成后没反应或提示失败怎么办？**
先检查文本是否为空、是否超过 1000 字；若提示「请求失败」，多为网络波动，稍后重试即可。页面顶部有使用额度提示，免费次数用完后需要登录或升级会员才能继续合成。

