# AI 语音唤醒词检测使用教程：浏览器本地识别唤醒词，麦克风实时监听

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/ai-wake-word-detector-guide

## 工具简介

**AI 语音唤醒词检测**是工具派推出的一款浏览器端语音 AI 工具：它把「小云小云」这类智能设备常用的唤醒词识别能力搬进了网页。工具在浏览器本地加载一个约 3MB 的 ONNX 关键词检测模型，实时监听麦克风输入，一旦识别到预设的唤醒词就会在检测日志中记录触发时间与置信度。整个流程的音频数据**只在本地处理、绝不上传服务器**，既适合体验语音唤醒技术原理，也能用来测试自己录音中的唤醒词识别效果，无需安装任何软件、打开即用。

## 功能亮点

- **浏览器本地 AI 推理**：使用本地 ONNX 模型完成关键词检测，音频不离开浏览器，隐私有保障，首次加载约 3MB 模型后会自动缓存，后续使用很快。
- **实时麦克风监听**：点一下「开始监听麦克风」即可持续监听，采用 1.5 秒分析窗、0.5 秒步进滑动识别，窗口间保持重叠，避免唤醒词跨窗被漏检。
- **5 档检测预设**：高灵敏、标准、低误触、长词模式、自定义，分别对应不同的置信阈值、连续命中次数和冷却时间，一键适配安静或嘈杂环境。
- **灵敏度自由调节**：检测灵敏度滑杆支持 30%–95% 的置信阈值，手动拖动后自动切换到「自定义」预设，方便精细平衡灵敏度与误报率。
- **唤醒词可自定义**：默认检测「小云小云」，可在输入框中换成词表内任意字符组合，点「设置」即生效，适合测试不同唤醒词。
- **本地音频文件测试**：不开麦克风也能用——上传一段本地音频文件，工具会自动解码并转成 16kHz 单声道后跑一次检测，给出命中结果与置信度。
- **检测日志记录**：每次成功触发都会按时间倒序记入检测日志，显示唤醒词、触发时刻和置信度，最多保留最近 50 条，方便回溯。

## 参数说明

| 参数 | 说明 | 默认值 / 取值范围 |
| --- | --- | --- |
| 检测预设 | 一键套用灵敏度、连续命中次数与冷却时间的组合方案 | 高灵敏 / 标准（默认）/ 低误触 / 长词模式 / 自定义 |
| 检测灵敏度 | 置信度阈值，只有识别置信度不低于该值才可能触发，越高越难触发、误报越少 | 默认 60%，范围 30%–95%，步进 5%；手动调节后自动切到「自定义」预设 |
| 唤醒词 | 要检测的目标词，仅支持模型词表中存在的字符，输入后点「设置」生效 | 默认「小云小云」；监听中不可修改 |
| 麦克风监听 | 点击「开始监听麦克风」授权后持续监听，再点「停止监听」结束 | 默认关闭，需浏览器麦克风权限 |
| 本地音频测试 | 上传本地音频文件（audio/*）跑一次离线检测 | 可选；音频会被解码并统一转为 16kHz 单声道 |
| 检测日志 | 命中记录的展示区域，含唤醒词、触发时间与置信度 | 最多保留 50 条，刷新页面后清空 |

## 使用步骤

1. **打开工具页面**：页面顶部是工具标题与简介，下方依次是检测预设、灵敏度滑杆、监听按钮、唤醒词设置、本地音频测试和检测日志，无需安装任何软件。

![AI 语音唤醒词检测主界面：顶部为工具标题与简介卡片；主体区域自上而下依次为「检测预设」五个按钮（高灵敏/标准/低误触/](article/202607/1783996208824_1228.png)

2. **选择检测预设**：在「检测预设」一行中按需点击——安静环境追求易触发可选「高灵敏」；日常默认用「标准」；嘈杂环境怕误报用「低误触」；唤醒词较长、希望完整发音更稳定时用「长词模式」。选好后下方会显示该预设的说明文字。

3. **微调检测灵敏度（可选）**：拖动「检测灵敏度」滑杆调节置信度阈值，下方实时显示当前阈值百分比。阈值越低越容易触发但误报越多，越高越严格。手动拖动后预设会自动切换为「自定义」。

4. **设置唤醒词（可选）**：默认检测「小云小云」。如需更换，在「唤醒词」输入框中输入新词并点击「设置」（或按回车），下方「当前」标签会更新。注意仅支持模型词表中存在的字符，且监听过程中不可修改。

5. **开始监听**：点击「🎙️ 开始监听麦克风」，首次使用会加载约 3MB 的本地模型并显示进度条，浏览器会弹出麦克风授权提示，允许后即开始实时监听。对着麦克风清晰说出唤醒词即可触发。

6. **查看结果与日志**：每次检测的「最新检测结果」会显示命中与否及置信度；成功触发后，记录会按时间倒序出现在「检测日志」中，包含唤醒词、触发时刻和置信度。检测完毕点「⏹ 停止监听」释放麦克风。

7. **用音频文件离线测试（可选）**：在「本地音频测试」中点击「选择文件」上传一段含唤醒词的录音，工具会自动解码并转成 16kHz 单声道后完成一次检测，结果同样显示在「最新检测结果」中。

## 使用技巧

- **先用「标准」预设打底**：它兼顾灵敏度与误触，适合大多数室内环境；确认能稳定触发后再根据实际表现切到「高灵敏」或「低误触」。
- **嘈杂环境优先「低误触」**：该预设要求更高置信度且连续命中多次才触发，能显著减少电视声、人声闲聊带来的误报。
- **灵敏度微调看百分比**：滑杆下方会显示当前阈值，建议每次只调 5%–10%，边说边观察「最新检测结果」里的置信度变化，找到刚好能稳定触发的位置。
- **换唤醒词后先测文件再开麦克风**：模型原本针对「小云小云」训练，换成其他词识别率可能下降，建议先上传一段录音做离线测试，确认效果再实时监听。
- **发音要清晰完整**：触发依赖连续的语音帧识别，吐字不清、语速过快或背景噪声大都会拉低置信度，尽量正对麦克风、用正常语速完整说出唤醒词。
- **长时间不用记得停止监听**：监听会持续占用麦克风和一定的浏览器计算资源，不用时点击「停止监听」，既省电也能避免隐私指示灯常亮。

## 常见问题

**Q1：用这个工具会把我的语音上传到服务器吗？**
不会。音频全程在浏览器本地用 ONNX 模型处理，不会上传到任何服务器，页面上的隐私提示也明确说明了这一点；首次加载的约 3MB 模型会自动缓存到本地。

**Q2：为什么点「开始监听麦克风」后浏览器弹出了权限提示？**
实时监听需要访问麦克风，浏览器会弹出授权请求，必须点击「允许」才能开始。如果误点了「拒绝」，需要在浏览器地址栏的站点权限设置中重新允许麦克风访问。

**Q3：几个检测预设有什么区别？**
它们本质是三组参数的组合：置信度阈值、需要连续命中的次数和两次触发间的冷却时间。「高灵敏」阈值低、一次命中即触发；「低误触」阈值高、需连续命中三次；「标准」居中；「长词模式」对完整发音更稳定；「自定义」则由你手动调阈值。

**Q4：为什么我说了唤醒词却没有触发？**
常见原因有四个：阈值设得过高，可适当调低灵敏度；环境嘈杂或发音不清导致置信度不足；唤醒词跨分析窗被切断（工具已用 1 秒重叠窗缓解，但极快语速仍可能漏检）；或麦克风实际没有输入，可检查系统音量和浏览器权限。

**Q5：可以把唤醒词改成任意词吗？**
不能随便改。唤醒词只能由模型词表中存在的字符组成，输入框会逐字符校验，遇到不支持的字符会报错；且模型原本针对「小云小云」训练，换成其他词即使能设置，识别率也可能下降。

**Q6：「本地音频测试」支持哪些格式？**
只要是浏览器能解码的音频（`audio/*`，如 MP3、WAV、M4A 等常见格式）都可以上传，工具会自动解码并统一转为 16kHz 单声道后再检测，无需自己预处理。

