工具简介
AI 文本转语音是工具派推出的一款在线语音合成工具:把文字粘贴进输入框,选好发音人、语速、音调和情感风格,点击「开始合成」,AI 就能生成一段自然流畅的中文语音,并提供在线试听和音频下载。它内置 5 种中文发音人、7 种情感风格,支持 MP3 / WAV 两种输出格式,还能上传一段背景音乐自动混入配音,甚至可以通过简单标签实现多人对话式的多角色配音,适合做视频旁白、有声读物、课件讲解和短视频配音。
参数说明
| 参数 | 说明 | 默认值 / 取值范围 |
|---|---|---|
| 文本内容 | 要转换成语音的文字,输入框右下角实时显示字数 | 必填,最多 1000 字 |
| 发音人 | 合成语音的音色,含 3 个女声、2 个男声 | 小云(女声,默认)、小刚(男声)、小美(女声)、小莉(女声)、小明(男声) |
| 输出格式 | 生成音频的文件格式 | MP3(默认)或 WAV |
| 语速 | 朗读快慢,负值变慢、正值变快 | 默认 0,范围 -50 ~ +50 |
| 音调 | 声音高低,负值低沉、正值尖细 | 默认 0,范围 -50 ~ +50 |
| 情感/风格 | 朗读的情绪与场景风格 | 标准(默认)、温柔、激昂、新闻、客服、纪录片、耳语 |
| 背景音乐(可选) | 上传一个音频文件作为配音背景,合成时自动混入 | 支持常见音频格式,不填则不混入 |
| 背景音乐音量 | 上传背景音乐后才出现的滑杆,控制背景音乐的音量比例 | 默认 30%,范围 0 ~ 100% |
另外,在文本中插入 <男声> / <女声> / <speaker1> 这类标签,可以让不同段落使用不同角色朗读,实现多角色配音;系统检测到标签后会自动按多角色模式合成。
使用步骤
- 打开工具页面:页面上方是工具名称和简介,下方白色卡片就是操作区,所有参数都在一个卡片内完成,无需安装任何软件。

输入文本内容:在「文本内容」输入框中粘贴或输入要转换的文字,最多 1000 字,右下角会实时显示「当前字数 / 1000」。如果文本为空,点击合成时会提示「请输入需要合成的文本」;超过 1000 字则提示超长,需要分段处理。
选择发音人与输出格式:在「发音人」下拉中选择音色——小云、小美、小莉是女声,小刚、小明是男声;在「输出格式」下拉中选择 MP3(体积小、通用)或 WAV(无损、适合二次剪辑)。
调节语速、音调与情感风格:拖动「语速」「音调」滑杆微调朗读效果,默认 0 表示标准状态,滑杆上方会实时显示当前数值(如「语速 +10」);在「情感/风格」下拉中选择朗读情绪,比如做新闻播报选「新闻」、讲故事选「温柔」、做促销配音选「激昂」。
(可选)添加背景音乐:点击「背景音乐(可选)」的「选择文件」上传一段音频,上传成功后会显示文件名和大小,并额外出现一个「背景音乐音量」滑杆,默认 30%,按需拖动调整,避免背景音乐盖过人声。
点击「开始合成」并等待结果:填写完成后点击底部蓝色「开始合成」按钮,按钮会变为「合成中...」。合成完成后页面下方出现「播放与下载」区域:可以先用播放器在线试听,满意后点击「下载音频」保存到本地,文件名形如
tts_时间戳.mp3。
使用技巧
- 多角色对话配音:在文本里用
<男声>和<女声>标签分隔不同角色的台词,例如「<女声>你好,请问需要什么帮助?<男声>我想了解一下会员权益。」,系统会自动识别并按多角色模式合成,适合做对话式短视频和有声剧。 - 语速音调小幅度调整更自然:语速和音调在 ±10 以内调整时听感最自然,数值拉得太极端(如 ±50)会出现明显的加速失真或变声感,建议边试听边微调。
- 情感风格要和内容匹配:「新闻」风格字正腔圆、节奏平稳,适合资讯播报;「纪录片」低沉舒缓,适合解说词;「耳语」音量轻、气息感强,适合助眠和悬疑氛围。
- 背景音乐音量宁低勿高:人声是主体时,背景音乐音量建议保持在 30% 以下,否则会喧宾夺主;上传前最好先把背景音乐裁剪成与文本朗读时长接近的长度。
- 长文本分段合成:单次最多 1000 字,长篇稿件可以按段落拆成多次合成,再把音频文件按顺序拼接,效果比硬塞进一段更稳定。
- 要二次剪辑就选 WAV:如果合成后还要进剪辑软件做降噪、混音,优先选 WAV 格式,避免 MP3 二次压缩带来的音质损失。
常见问题
Q1:合成的语音可以试听吗?
可以。合成成功后页面下方会出现「播放与下载」区域,内置播放器可以直接在线试听,确认满意后再点「下载音频」保存,不满意就调参数重新合成。
Q2:文本里的 <男声> <女声> 标签是什么意思?
这是多角色配音标记。在文本中用这些标签包住不同角色的台词,系统检测到标签后会自动切换为多角色合成模式,让不同段落用不同音色朗读,适合做对话类内容。不需要多角色时直接写普通文本即可。
Q3:MP3 和 WAV 怎么选?
MP3 体积小、兼容性好,直接用于视频配音、公众号语音等场景选它即可;WAV 是无损格式,文件更大,适合还要进专业剪辑软件二次处理的情况。
Q4:上传的背景音乐有什么要求?
支持常见音频格式,上传后卡片下方会显示文件名和大小,并出现音量调节滑杆(默认 30%)。建议选用纯音乐、无歌词的素材,并提前裁剪到与朗读时长相近的长度。
Q5:点击合成后没反应或提示失败怎么办?
先检查文本是否为空、是否超过 1000 字;若提示「请求失败」,多为网络波动,稍后重试即可。页面顶部有使用额度提示,免费次数用完后需要登录或升级会员才能继续合成。
