# AI 环境音识别使用教程：本地识别雨声车流鸟鸣，实时麦克风监听

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/ai-environment-sound-recognition-guide

## 工具简介

**AI 环境音识别**是工具派推出的一款本地 AI 音频分析工具：上传一段音频或直接用麦克风录音，工具会在浏览器本地加载 YAMNet 声音分类模型（基于 Google AudioSet 标签体系），自动识别音频中包含的环境声音事件——雨声、雷声、风声、海浪、鸟鸣、狗叫、车流、警笛、施工、键盘敲击等上百种环境音类别都能识别，并给出每个类别的置信度百分比。除了上传文件分析，它还支持**实时麦克风监听**模式：每 10 秒分析一次周围声音，把检测到的环境音事件按时间记入日志。整个过程音频不离开浏览器，不会上传到服务器，首次加载约 16MB 模型后会自动缓存，之后再用几乎秒开。

## 功能亮点

- **本地 AI 识别，隐私安全**：音频仅在浏览器本地处理，不上传服务器；首次使用加载约 16MB 的 YAMNet 模型，加载后自动缓存，后续使用很快。
- **覆盖百余种环境音类别**：内置雨声、雷声、风、水、火、森林、鸟鸣、猫狗等动物声、车流、火车、飞机、警笛、施工、家电、键盘鼠标等环境音关键词体系，常见标签自动翻译为中文显示。
- **三种音频来源**：支持拖拽、粘贴或点击上传音频文件（最大 20MB），也可以点击「录音识别」直接用麦克风录制最长 30 秒的音频，还能开启实时监听持续分析环境声。
- **结果数量与置信度可调**：「显示 Top 3 / 5 / 10」控制展示的类别数量，「置信度阈值」滑杆（0%–90%）过滤低分结果，只看把握大的识别项。
- **实时麦克风监听**：点击「开始实时监听」后每 10 秒分析一次麦克风音频，检测到的环境音事件连同时间和置信度写入「实时事件日志」（最多保留 50 条，可一键清空）。
- **结果可试听可导出**：识别结果区自带音频播放器可回放原音频，每个识别项以「标签 + 百分比 + 进度条」展示，并支持一键**导出 JSON** 或**导出 CSV** 留档。

## 参数说明

| 参数 | 说明 | 默认值 / 取值范围 |
| --- | --- | --- |
| 上传环境音音频 | 拖拽、粘贴或点击上传的音频文件，仅接受音频格式 | 最大 20MB，`audio/*` |
| 录音识别 | 使用麦克风现场录制音频并直接送入识别 | 最长 30 秒，数据仅本地处理 |
| 显示 Top K | 识别结果中展示的类别数量，三个按钮切换 | Top 3 / Top 5（默认）/ Top 10 |
| 置信度阈值 | 过滤掉置信度低于该值的结果，同时作用于文件识别与实时监听 | 默认 0%，范围 0%–90%，步长 5% |
| 实时麦克风监听 | 「开始实时监听」后每 10 秒分析一次麦克风音频，结果写入事件日志；再次点击「停止监听」结束 | 默认关闭，需授权麦克风权限 |
| 静音过滤 | 实时监听区的静音阈值滑杆，用于标注期望过滤的安静环境分贝线 | 默认 -50 dB，范围 -70 ~ -20 dB，步长 5 dB |
| 开始识别 | 对当前上传 / 录制的音频运行 YAMNet 模型分析 | 首次识别前会显示模型加载进度条 |

## 使用步骤

1. **打开工具页面**：页面顶部是工具标题与简介，主体依次是上传区、录音按钮、Top K 与置信度阈值调节、实时麦克风监听区和蓝色的「开始识别」按钮，无需安装任何软件。

![AI 环境音识别主界面：顶部为工具标题与简介卡片；主体依次为「上传环境音音频」拖拽上传框（含隐私说明：本地处理、首次加载](article/202607/1783995038713_8615.png)

2. **准备音频**：把音频文件拖进「上传环境音音频」虚线框（也支持粘贴或点击选择，最大 20MB）；或者点击「录音识别」按钮，授权麦克风后现场录制最长 30 秒的环境音，录完自动填入。

3. **调节显示参数**：用「显示 Top 3 / 5 / 10」选择想看到的类别数量；如果结果里低分项太多，把「置信度阈值」滑杆向右拖到 30%–50%，只保留把握较大的识别结果。

4. **开始识别**：点击「开始识别」按钮。首次使用会先加载约 16MB 的 YAMNet 模型并显示进度条，加载完成后自动分析，结果区按置信度从高到低列出「雨声 87%」「交通噪音 42%」这样的条目，每项配一条百分比进度条，上方还有播放器可以回放原音频。

5. **（可选）开启实时监听**：想持续监测周围声音时，点击「🎙️ 开始实时监听」并授权麦克风，工具每 10 秒分析一次，把检测到的环境音事件连同发生时间记入「实时事件日志」（最新在上、最多 50 条），点「⏹ 停止监听」结束，日志可一键「清空」。

6. **导出结果**：识别完成后，在结果区右上角点击「导出 JSON」或「导出 CSV」，把「标签 + 置信度」的完整列表保存到本地，方便整理归档或做进一步统计。

## 使用技巧

- **音频里要有「环境声」才有结果**：该工具只展示匹配环境音关键词的类别（雨、风、车流、动物、施工、家电等），纯音乐或纯人声的音频可能提示「未识别到明显的环境音」，这是正常的过滤行为而非故障。
- **结果太杂就调高阈值**：默认阈值 0% 会展示所有非零结果，容易混入 1%–2% 的噪声项；把置信度阈值拖到 30% 以上，列表会立刻干净很多。
- **把握不准就先降阈值排查**：如果什么都没识别出来，按页面提示依次检查：音频是否包含环境音、阈值是否设得太高、音频是否过短或过于安静。
- **实时监听适合固定场景**：把电脑放在窗边或工位上开启实时监听，事件日志会按时间记录「什么时候出现了狗叫、警笛、施工声」，适合做简易的环境声音记录。
- **先用 30 秒录音快速试模型**：不想找音频文件时，直接点「录音识别」对着麦克风制造点声音（敲桌子、倒水、开窗），几十秒就能验证识别效果。
- **留档用 CSV，程序处理用 JSON**：CSV 适合用 Excel 打开整理，JSON 保留原始结构，适合写脚本批量分析多次识别结果。

## 常见问题

**Q1：上传的音频会被传到服务器吗？**
不会。音频全程在浏览器本地由 YAMNet 模型处理，页面也明确标注「不会上传到服务器」。首次使用需要下载约 16MB 的模型文件，之后会自动缓存，后续识别完全离线进行。

**Q2：为什么识别结果全是英文标签？**
工具内置了常见环境音标签的中文对照（雨声、鸟鸣声、交通噪音等），命中对照表的标签会自动显示中文；个别冷门标签没有中文译名时会原样显示英文，不影响置信度数值的参考意义。

**Q3：识别音乐或人声为什么没有结果？**
该工具面向「环境音」场景，结果列表只保留与环境音关键词（自然声、动物声、交通、机械、家电等）匹配的类别。纯歌曲、纯讲话的音频会被过滤掉并提示未识别到明显环境音，可换含背景环境声的音频，或降低置信度阈值再试。

**Q4：实时监听是怎么工作的？**
点击「开始实时监听」授权麦克风后，工具每 10 秒截取一段麦克风音频送入模型分析，把超过置信度阈值的环境音事件连同当前时间写入「实时事件日志」，最多保留最近 50 条；点「停止监听」即释放麦克风。

**Q5：录音最长能录多久？支持哪些音频格式？**
「录音识别」最长录制 30 秒，适合快速采样；上传文件则支持浏览器可解码的常见音频格式（`audio/*`），单个文件最大 20MB，格式不对或超限会有明确错误提示。

**Q6：导出的 CSV / JSON 里有什么内容？**
两者都包含本次识别的完整结果列表：每项的环境音标签和对应置信度百分比。注意导出的是全部原始结果，不受「显示 Top K」和环境音过滤的影响，数据比页面上展示的更全。

