音频转文字教程:本地AI语音识别,还能导出SRT字幕

音频转文字教程:本地AI语音识别,还能导出SRT字幕

📁 音频👁️ 156 阅读⏱️ 3 分钟阅读🕒 2026/9/14

音频转文字工具在浏览器本地运行 AI 语音识别,音频不上传服务器,支持中文/英语/自动检测,识别结果可导出纯文本 TXT 或 SRT/VTT 字幕文件。

图片

图片

图片

工具简介

音频转文字是一款注重隐私的语音识别工具:AI 模型直接在浏览器本地运行,MP3、WAV、M4A、FLAC、OGG 等音频文件不会上传到任何服务器,会议录音、采访素材等敏感内容也能放心识别。支持中文普通话、英语和自动检测三种语言模式,识别结果可以导出为纯文本 TXT,也能导出带时间轴的 SRT / VTT 字幕文件,直接用于视频字幕制作。

单个文件最大支持 10MB(约 10 分钟音频),适合会议纪要、课堂录音、播客文稿、字幕初稿等场景。

音频转文字工具界面

第一步:上传音频文件

点击上传区域选择音频文件,或直接把文件拖拽到网页中。上传后下方会显示已选文件名,「开始转文字」按钮由灰变绿。

支持格式:MP3 / WAV / M4A / FLAC / OGG,最大 10MB(约 10 分钟)。如果音频更长,建议先用音频工具裁剪分段后再识别。

上传音频文件

第二步:设置识别参数

  • 识别语言:中文(普通话/简体)、英语、自动检测三种可选。中文音频选中文准确率最高,识别结果会自动转为简体;不确定语言时选自动检测;
  • 输出格式
    • 纯文本 TXT:只要文字稿,适合会议纪要、文稿整理;
    • SRT 字幕:带时间轴, Premiere、剪映等剪辑软件可直接导入;
    • VTT 字幕:网页播放器(HTML5 video)标准字幕格式。

确认设置开始识别

参数说明

参数 类型 可选值 说明
文件上传 文件选择 MP3/WAV/M4A/FLAC/OGG 最大 10MB,本地处理
识别语言 下拉 中文(普通话/简体)/ 英语 / 自动检测 中文结果自动转简体
输出格式 下拉 纯文本 TXT / SRT 字幕 / VTT 字幕 决定下载文件类型
开始转文字 按钮 上传文件后激活

第三步:查看结果并下载

点击「开始转文字」后,页面会显示模型加载和识别进度(首次使用需要加载 AI 模型,稍等片刻)。识别完成后,右侧「识别结果」区域显示完整文字稿,可以一键复制,或按所选格式下载文件。

选择 SRT/VTT 格式时,文字稿会按语句自动切分时间轴,导入剪辑软件即为可用字幕。

常见问题

Q:识别要联网吗?安全吗?
A:首次使用需联网下载 AI 模型到浏览器缓存,之后识别过程全部在本地运行,音频不会上传到服务器。

Q:为什么限制 10MB?
A:识别在浏览器里运行,受内存和算力限制,10MB(约 10 分钟)是稳定运行的经验上限。

Q:识别准确率怎么样?
A:清晰普通话录音准确率较高;背景噪音大、多人抢话或方言较重时准确率会下降,建议先用「音频降噪」处理。

Q:能识别视频里的声音吗?
A:可以先用「视频音频提取」把视频转成 MP3,再来这里转文字。

总结与相关工具

音频转文字三步完成:上传音频 → 选语言和格式 → 识别下载。搭配以下工具可以覆盖更多语音处理场景: