工具简介
AI 环境音识别是工具派推出的一款本地 AI 音频分析工具:上传一段音频或直接用麦克风录音,工具会在浏览器本地加载 YAMNet 声音分类模型(基于 Google AudioSet 标签体系),自动识别音频中包含的环境声音事件——雨声、雷声、风声、海浪、鸟鸣、狗叫、车流、警笛、施工、键盘敲击等上百种环境音类别都能识别,并给出每个类别的置信度百分比。除了上传文件分析,它还支持实时麦克风监听模式:每 10 秒分析一次周围声音,把检测到的环境音事件按时间记入日志。整个过程音频不离开浏览器,不会上传到服务器,首次加载约 16MB 模型后会自动缓存,之后再用几乎秒开。
功能亮点
- 本地 AI 识别,隐私安全:音频仅在浏览器本地处理,不上传服务器;首次使用加载约 16MB 的 YAMNet 模型,加载后自动缓存,后续使用很快。
- 覆盖百余种环境音类别:内置雨声、雷声、风、水、火、森林、鸟鸣、猫狗等动物声、车流、火车、飞机、警笛、施工、家电、键盘鼠标等环境音关键词体系,常见标签自动翻译为中文显示。
- 三种音频来源:支持拖拽、粘贴或点击上传音频文件(最大 20MB),也可以点击「录音识别」直接用麦克风录制最长 30 秒的音频,还能开启实时监听持续分析环境声。
- 结果数量与置信度可调:「显示 Top 3 / 5 / 10」控制展示的类别数量,「置信度阈值」滑杆(0%–90%)过滤低分结果,只看把握大的识别项。
- 实时麦克风监听:点击「开始实时监听」后每 10 秒分析一次麦克风音频,检测到的环境音事件连同时间和置信度写入「实时事件日志」(最多保留 50 条,可一键清空)。
- 结果可试听可导出:识别结果区自带音频播放器可回放原音频,每个识别项以「标签 + 百分比 + 进度条」展示,并支持一键导出 JSON 或导出 CSV 留档。
参数说明
| 参数 | 说明 | 默认值 / 取值范围 |
|---|---|---|
| 上传环境音音频 | 拖拽、粘贴或点击上传的音频文件,仅接受音频格式 | 最大 20MB,audio/* |
| 录音识别 | 使用麦克风现场录制音频并直接送入识别 | 最长 30 秒,数据仅本地处理 |
| 显示 Top K | 识别结果中展示的类别数量,三个按钮切换 | Top 3 / Top 5(默认)/ Top 10 |
| 置信度阈值 | 过滤掉置信度低于该值的结果,同时作用于文件识别与实时监听 | 默认 0%,范围 0%–90%,步长 5% |
| 实时麦克风监听 | 「开始实时监听」后每 10 秒分析一次麦克风音频,结果写入事件日志;再次点击「停止监听」结束 | 默认关闭,需授权麦克风权限 |
| 静音过滤 | 实时监听区的静音阈值滑杆,用于标注期望过滤的安静环境分贝线 | 默认 -50 dB,范围 -70 ~ -20 dB,步长 5 dB |
| 开始识别 | 对当前上传 / 录制的音频运行 YAMNet 模型分析 | 首次识别前会显示模型加载进度条 |
使用步骤
- 打开工具页面:页面顶部是工具标题与简介,主体依次是上传区、录音按钮、Top K 与置信度阈值调节、实时麦克风监听区和蓝色的「开始识别」按钮,无需安装任何软件。

准备音频:把音频文件拖进「上传环境音音频」虚线框(也支持粘贴或点击选择,最大 20MB);或者点击「录音识别」按钮,授权麦克风后现场录制最长 30 秒的环境音,录完自动填入。
调节显示参数:用「显示 Top 3 / 5 / 10」选择想看到的类别数量;如果结果里低分项太多,把「置信度阈值」滑杆向右拖到 30%–50%,只保留把握较大的识别结果。
开始识别:点击「开始识别」按钮。首次使用会先加载约 16MB 的 YAMNet 模型并显示进度条,加载完成后自动分析,结果区按置信度从高到低列出「雨声 87%」「交通噪音 42%」这样的条目,每项配一条百分比进度条,上方还有播放器可以回放原音频。
(可选)开启实时监听:想持续监测周围声音时,点击「🎙️ 开始实时监听」并授权麦克风,工具每 10 秒分析一次,把检测到的环境音事件连同发生时间记入「实时事件日志」(最新在上、最多 50 条),点「⏹ 停止监听」结束,日志可一键「清空」。
导出结果:识别完成后,在结果区右上角点击「导出 JSON」或「导出 CSV」,把「标签 + 置信度」的完整列表保存到本地,方便整理归档或做进一步统计。
使用技巧
- 音频里要有「环境声」才有结果:该工具只展示匹配环境音关键词的类别(雨、风、车流、动物、施工、家电等),纯音乐或纯人声的音频可能提示「未识别到明显的环境音」,这是正常的过滤行为而非故障。
- 结果太杂就调高阈值:默认阈值 0% 会展示所有非零结果,容易混入 1%–2% 的噪声项;把置信度阈值拖到 30% 以上,列表会立刻干净很多。
- 把握不准就先降阈值排查:如果什么都没识别出来,按页面提示依次检查:音频是否包含环境音、阈值是否设得太高、音频是否过短或过于安静。
- 实时监听适合固定场景:把电脑放在窗边或工位上开启实时监听,事件日志会按时间记录「什么时候出现了狗叫、警笛、施工声」,适合做简易的环境声音记录。
- 先用 30 秒录音快速试模型:不想找音频文件时,直接点「录音识别」对着麦克风制造点声音(敲桌子、倒水、开窗),几十秒就能验证识别效果。
- 留档用 CSV,程序处理用 JSON:CSV 适合用 Excel 打开整理,JSON 保留原始结构,适合写脚本批量分析多次识别结果。
常见问题
Q1:上传的音频会被传到服务器吗?
不会。音频全程在浏览器本地由 YAMNet 模型处理,页面也明确标注「不会上传到服务器」。首次使用需要下载约 16MB 的模型文件,之后会自动缓存,后续识别完全离线进行。
Q2:为什么识别结果全是英文标签?
工具内置了常见环境音标签的中文对照(雨声、鸟鸣声、交通噪音等),命中对照表的标签会自动显示中文;个别冷门标签没有中文译名时会原样显示英文,不影响置信度数值的参考意义。
Q3:识别音乐或人声为什么没有结果?
该工具面向「环境音」场景,结果列表只保留与环境音关键词(自然声、动物声、交通、机械、家电等)匹配的类别。纯歌曲、纯讲话的音频会被过滤掉并提示未识别到明显环境音,可换含背景环境声的音频,或降低置信度阈值再试。
Q4:实时监听是怎么工作的?
点击「开始实时监听」授权麦克风后,工具每 10 秒截取一段麦克风音频送入模型分析,把超过置信度阈值的环境音事件连同当前时间写入「实时事件日志」,最多保留最近 50 条;点「停止监听」即释放麦克风。
Q5:录音最长能录多久?支持哪些音频格式?
「录音识别」最长录制 30 秒,适合快速采样;上传文件则支持浏览器可解码的常见音频格式(audio/*),单个文件最大 20MB,格式不对或超限会有明确错误提示。
Q6:导出的 CSV / JSON 里有什么内容?
两者都包含本次识别的完整结果列表:每项的环境音标签和对应置信度百分比。注意导出的是全部原始结果,不受「显示 Top K」和环境音过滤的影响,数据比页面上展示的更全。
