# 音频转文字教程：本地AI语音识别，还能导出SRT字幕

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/audio-to-text-guide


![图片](/api/file/download?path=article/202607/1783912444204_5217.png)

![图片](/api/file/download?path=article/202607/1783912456149_7569.png)

![图片](/api/file/download?path=article/202607/1783912467780_8046.png)
## 工具简介

音频转文字是一款注重隐私的语音识别工具：AI 模型直接在浏览器本地运行，MP3、WAV、M4A、FLAC、OGG 等音频文件不会上传到任何服务器，会议录音、采访素材等敏感内容也能放心识别。支持中文普通话、英语和自动检测三种语言模式，识别结果可以导出为纯文本 TXT，也能导出带时间轴的 SRT / VTT 字幕文件，直接用于视频字幕制作。

单个文件最大支持 10MB（约 10 分钟音频），适合会议纪要、课堂录音、播客文稿、字幕初稿等场景。

![音频转文字工具界面](/api/file/download?path=article/202607/1783912444204_5217.png)

## 第一步：上传音频文件

点击上传区域选择音频文件，或直接把文件拖拽到网页中。上传后下方会显示已选文件名，「开始转文字」按钮由灰变绿。

支持格式：MP3 / WAV / M4A / FLAC / OGG，最大 10MB（约 10 分钟）。如果音频更长，建议先用音频工具裁剪分段后再识别。

![上传音频文件](/api/file/download?path=article/202607/1783912456149_7569.png)

## 第二步：设置识别参数

- **识别语言**：中文（普通话/简体）、英语、自动检测三种可选。中文音频选中文准确率最高，识别结果会自动转为简体；不确定语言时选自动检测；
- **输出格式**：
  - 纯文本 TXT：只要文字稿，适合会议纪要、文稿整理；
  - SRT 字幕：带时间轴， Premiere、剪映等剪辑软件可直接导入；
  - VTT 字幕：网页播放器（HTML5 video）标准字幕格式。

![确认设置开始识别](/api/file/download?path=article/202607/1783912467780_8046.png)

## 参数说明

| 参数 | 类型 | 可选值 | 说明 |
| --- | --- | --- | --- |
| 文件上传 | 文件选择 | MP3/WAV/M4A/FLAC/OGG | 最大 10MB，本地处理 |
| 识别语言 | 下拉 | 中文（普通话/简体）/ 英语 / 自动检测 | 中文结果自动转简体 |
| 输出格式 | 下拉 | 纯文本 TXT / SRT 字幕 / VTT 字幕 | 决定下载文件类型 |
| 开始转文字 | 按钮 | — | 上传文件后激活 |

## 第三步：查看结果并下载

点击「开始转文字」后，页面会显示模型加载和识别进度（首次使用需要加载 AI 模型，稍等片刻）。识别完成后，右侧「识别结果」区域显示完整文字稿，可以一键复制，或按所选格式下载文件。

选择 SRT/VTT 格式时，文字稿会按语句自动切分时间轴，导入剪辑软件即为可用字幕。

## 常见问题

**Q：识别要联网吗？安全吗？**
A：首次使用需联网下载 AI 模型到浏览器缓存，之后识别过程全部在本地运行，音频不会上传到服务器。

**Q：为什么限制 10MB？**
A：识别在浏览器里运行，受内存和算力限制，10MB（约 10 分钟）是稳定运行的经验上限。

**Q：识别准确率怎么样？**
A：清晰普通话录音准确率较高；背景噪音大、多人抢话或方言较重时准确率会下降，建议先用「音频降噪」处理。

**Q：能识别视频里的声音吗？**
A：可以先用「视频音频提取」把视频转成 MP3，再来这里转文字。

## 总结与相关工具

音频转文字三步完成：上传音频 → 选语言和格式 → 识别下载。搭配以下工具可以覆盖更多语音处理场景：

- [视频音频提取](/tools/video_audio)：从视频中提取音频再转文字；
- [音频降噪](/tools/audio_denoise)：噪音大的录音先降噪提高识别率；
- [音频格式转换器](/tools/audio_converter)：音频格式互转；
- [视频自动字幕](/tools/auto_subtitle)：直接给视频生成字幕文件。
