AI 环境音识别使用教程:本地识别雨声车流鸟鸣,实时麦克风监听

AI 环境音识别使用教程:本地识别雨声车流鸟鸣,实时麦克风监听

📁 音频👁️ 147 阅读⏱️ 6 分钟阅读🕒 2026/9/14

免费在线 AI 环境音识别工具,基于 YAMNet 模型在浏览器本地识别雨声、雷声、鸟鸣、车流、施工等环境音,支持上传音频、30 秒录音与实时麦克风监听,结果可导出 JSON/CSV,全程不上传音频。

工具简介

AI 环境音识别是工具派推出的一款本地 AI 音频分析工具:上传一段音频或直接用麦克风录音,工具会在浏览器本地加载 YAMNet 声音分类模型(基于 Google AudioSet 标签体系),自动识别音频中包含的环境声音事件——雨声、雷声、风声、海浪、鸟鸣、狗叫、车流、警笛、施工、键盘敲击等上百种环境音类别都能识别,并给出每个类别的置信度百分比。除了上传文件分析,它还支持实时麦克风监听模式:每 10 秒分析一次周围声音,把检测到的环境音事件按时间记入日志。整个过程音频不离开浏览器,不会上传到服务器,首次加载约 16MB 模型后会自动缓存,之后再用几乎秒开。

功能亮点

  • 本地 AI 识别,隐私安全:音频仅在浏览器本地处理,不上传服务器;首次使用加载约 16MB 的 YAMNet 模型,加载后自动缓存,后续使用很快。
  • 覆盖百余种环境音类别:内置雨声、雷声、风、水、火、森林、鸟鸣、猫狗等动物声、车流、火车、飞机、警笛、施工、家电、键盘鼠标等环境音关键词体系,常见标签自动翻译为中文显示。
  • 三种音频来源:支持拖拽、粘贴或点击上传音频文件(最大 20MB),也可以点击「录音识别」直接用麦克风录制最长 30 秒的音频,还能开启实时监听持续分析环境声。
  • 结果数量与置信度可调:「显示 Top 3 / 5 / 10」控制展示的类别数量,「置信度阈值」滑杆(0%–90%)过滤低分结果,只看把握大的识别项。
  • 实时麦克风监听:点击「开始实时监听」后每 10 秒分析一次麦克风音频,检测到的环境音事件连同时间和置信度写入「实时事件日志」(最多保留 50 条,可一键清空)。
  • 结果可试听可导出:识别结果区自带音频播放器可回放原音频,每个识别项以「标签 + 百分比 + 进度条」展示,并支持一键导出 JSON导出 CSV 留档。

参数说明

参数 说明 默认值 / 取值范围
上传环境音音频 拖拽、粘贴或点击上传的音频文件,仅接受音频格式 最大 20MB,audio/*
录音识别 使用麦克风现场录制音频并直接送入识别 最长 30 秒,数据仅本地处理
显示 Top K 识别结果中展示的类别数量,三个按钮切换 Top 3 / Top 5(默认)/ Top 10
置信度阈值 过滤掉置信度低于该值的结果,同时作用于文件识别与实时监听 默认 0%,范围 0%–90%,步长 5%
实时麦克风监听 「开始实时监听」后每 10 秒分析一次麦克风音频,结果写入事件日志;再次点击「停止监听」结束 默认关闭,需授权麦克风权限
静音过滤 实时监听区的静音阈值滑杆,用于标注期望过滤的安静环境分贝线 默认 -50 dB,范围 -70 ~ -20 dB,步长 5 dB
开始识别 对当前上传 / 录制的音频运行 YAMNet 模型分析 首次识别前会显示模型加载进度条

使用步骤

  1. 打开工具页面:页面顶部是工具标题与简介,主体依次是上传区、录音按钮、Top K 与置信度阈值调节、实时麦克风监听区和蓝色的「开始识别」按钮,无需安装任何软件。

AI 环境音识别主界面:顶部为工具标题与简介卡片;主体依次为「上传环境音音频」拖拽上传框(含隐私说明:本地处理、首次加载

  1. 准备音频:把音频文件拖进「上传环境音音频」虚线框(也支持粘贴或点击选择,最大 20MB);或者点击「录音识别」按钮,授权麦克风后现场录制最长 30 秒的环境音,录完自动填入。

  2. 调节显示参数:用「显示 Top 3 / 5 / 10」选择想看到的类别数量;如果结果里低分项太多,把「置信度阈值」滑杆向右拖到 30%–50%,只保留把握较大的识别结果。

  3. 开始识别:点击「开始识别」按钮。首次使用会先加载约 16MB 的 YAMNet 模型并显示进度条,加载完成后自动分析,结果区按置信度从高到低列出「雨声 87%」「交通噪音 42%」这样的条目,每项配一条百分比进度条,上方还有播放器可以回放原音频。

  4. (可选)开启实时监听:想持续监测周围声音时,点击「🎙️ 开始实时监听」并授权麦克风,工具每 10 秒分析一次,把检测到的环境音事件连同发生时间记入「实时事件日志」(最新在上、最多 50 条),点「⏹ 停止监听」结束,日志可一键「清空」。

  5. 导出结果:识别完成后,在结果区右上角点击「导出 JSON」或「导出 CSV」,把「标签 + 置信度」的完整列表保存到本地,方便整理归档或做进一步统计。

使用技巧

  • 音频里要有「环境声」才有结果:该工具只展示匹配环境音关键词的类别(雨、风、车流、动物、施工、家电等),纯音乐或纯人声的音频可能提示「未识别到明显的环境音」,这是正常的过滤行为而非故障。
  • 结果太杂就调高阈值:默认阈值 0% 会展示所有非零结果,容易混入 1%–2% 的噪声项;把置信度阈值拖到 30% 以上,列表会立刻干净很多。
  • 把握不准就先降阈值排查:如果什么都没识别出来,按页面提示依次检查:音频是否包含环境音、阈值是否设得太高、音频是否过短或过于安静。
  • 实时监听适合固定场景:把电脑放在窗边或工位上开启实时监听,事件日志会按时间记录「什么时候出现了狗叫、警笛、施工声」,适合做简易的环境声音记录。
  • 先用 30 秒录音快速试模型:不想找音频文件时,直接点「录音识别」对着麦克风制造点声音(敲桌子、倒水、开窗),几十秒就能验证识别效果。
  • 留档用 CSV,程序处理用 JSON:CSV 适合用 Excel 打开整理,JSON 保留原始结构,适合写脚本批量分析多次识别结果。

常见问题

Q1:上传的音频会被传到服务器吗?
不会。音频全程在浏览器本地由 YAMNet 模型处理,页面也明确标注「不会上传到服务器」。首次使用需要下载约 16MB 的模型文件,之后会自动缓存,后续识别完全离线进行。

Q2:为什么识别结果全是英文标签?
工具内置了常见环境音标签的中文对照(雨声、鸟鸣声、交通噪音等),命中对照表的标签会自动显示中文;个别冷门标签没有中文译名时会原样显示英文,不影响置信度数值的参考意义。

Q3:识别音乐或人声为什么没有结果?
该工具面向「环境音」场景,结果列表只保留与环境音关键词(自然声、动物声、交通、机械、家电等)匹配的类别。纯歌曲、纯讲话的音频会被过滤掉并提示未识别到明显环境音,可换含背景环境声的音频,或降低置信度阈值再试。

Q4:实时监听是怎么工作的?
点击「开始实时监听」授权麦克风后,工具每 10 秒截取一段麦克风音频送入模型分析,把超过置信度阈值的环境音事件连同当前时间写入「实时事件日志」,最多保留最近 50 条;点「停止监听」即释放麦克风。

Q5:录音最长能录多久?支持哪些音频格式?
「录音识别」最长录制 30 秒,适合快速采样;上传文件则支持浏览器可解码的常见音频格式(audio/*),单个文件最大 20MB,格式不对或超限会有明确错误提示。

Q6:导出的 CSV / JSON 里有什么内容?
两者都包含本次识别的完整结果列表:每项的环境音标签和对应置信度百分比。注意导出的是全部原始结果,不受「显示 Top K」和环境音过滤的影响,数据比页面上展示的更全。