AI 语音唤醒词检测使用教程:浏览器本地识别唤醒词,麦克风实时监听

AI 语音唤醒词检测使用教程:浏览器本地识别唤醒词,麦克风实时监听

📁 音频👁️ 146 阅读⏱️ 6 分钟阅读🕒 2026/9/14

免费在线 AI 语音唤醒词检测工具,浏览器本地加载 ONNX 模型实时监听麦克风,识别「小云小云」等中文唤醒词,音频不上传服务器,支持灵敏度调节与本地音频文件测试。

工具简介

AI 语音唤醒词检测是工具派推出的一款浏览器端语音 AI 工具:它把「小云小云」这类智能设备常用的唤醒词识别能力搬进了网页。工具在浏览器本地加载一个约 3MB 的 ONNX 关键词检测模型,实时监听麦克风输入,一旦识别到预设的唤醒词就会在检测日志中记录触发时间与置信度。整个流程的音频数据只在本地处理、绝不上传服务器,既适合体验语音唤醒技术原理,也能用来测试自己录音中的唤醒词识别效果,无需安装任何软件、打开即用。

功能亮点

  • 浏览器本地 AI 推理:使用本地 ONNX 模型完成关键词检测,音频不离开浏览器,隐私有保障,首次加载约 3MB 模型后会自动缓存,后续使用很快。
  • 实时麦克风监听:点一下「开始监听麦克风」即可持续监听,采用 1.5 秒分析窗、0.5 秒步进滑动识别,窗口间保持重叠,避免唤醒词跨窗被漏检。
  • 5 档检测预设:高灵敏、标准、低误触、长词模式、自定义,分别对应不同的置信阈值、连续命中次数和冷却时间,一键适配安静或嘈杂环境。
  • 灵敏度自由调节:检测灵敏度滑杆支持 30%–95% 的置信阈值,手动拖动后自动切换到「自定义」预设,方便精细平衡灵敏度与误报率。
  • 唤醒词可自定义:默认检测「小云小云」,可在输入框中换成词表内任意字符组合,点「设置」即生效,适合测试不同唤醒词。
  • 本地音频文件测试:不开麦克风也能用——上传一段本地音频文件,工具会自动解码并转成 16kHz 单声道后跑一次检测,给出命中结果与置信度。
  • 检测日志记录:每次成功触发都会按时间倒序记入检测日志,显示唤醒词、触发时刻和置信度,最多保留最近 50 条,方便回溯。

参数说明

参数 说明 默认值 / 取值范围
检测预设 一键套用灵敏度、连续命中次数与冷却时间的组合方案 高灵敏 / 标准(默认)/ 低误触 / 长词模式 / 自定义
检测灵敏度 置信度阈值,只有识别置信度不低于该值才可能触发,越高越难触发、误报越少 默认 60%,范围 30%–95%,步进 5%;手动调节后自动切到「自定义」预设
唤醒词 要检测的目标词,仅支持模型词表中存在的字符,输入后点「设置」生效 默认「小云小云」;监听中不可修改
麦克风监听 点击「开始监听麦克风」授权后持续监听,再点「停止监听」结束 默认关闭,需浏览器麦克风权限
本地音频测试 上传本地音频文件(audio/*)跑一次离线检测 可选;音频会被解码并统一转为 16kHz 单声道
检测日志 命中记录的展示区域,含唤醒词、触发时间与置信度 最多保留 50 条,刷新页面后清空

使用步骤

  1. 打开工具页面:页面顶部是工具标题与简介,下方依次是检测预设、灵敏度滑杆、监听按钮、唤醒词设置、本地音频测试和检测日志,无需安装任何软件。

AI 语音唤醒词检测主界面:顶部为工具标题与简介卡片;主体区域自上而下依次为「检测预设」五个按钮(高灵敏/标准/低误触/

  1. 选择检测预设:在「检测预设」一行中按需点击——安静环境追求易触发可选「高灵敏」;日常默认用「标准」;嘈杂环境怕误报用「低误触」;唤醒词较长、希望完整发音更稳定时用「长词模式」。选好后下方会显示该预设的说明文字。

  2. 微调检测灵敏度(可选):拖动「检测灵敏度」滑杆调节置信度阈值,下方实时显示当前阈值百分比。阈值越低越容易触发但误报越多,越高越严格。手动拖动后预设会自动切换为「自定义」。

  3. 设置唤醒词(可选):默认检测「小云小云」。如需更换,在「唤醒词」输入框中输入新词并点击「设置」(或按回车),下方「当前」标签会更新。注意仅支持模型词表中存在的字符,且监听过程中不可修改。

  4. 开始监听:点击「🎙️ 开始监听麦克风」,首次使用会加载约 3MB 的本地模型并显示进度条,浏览器会弹出麦克风授权提示,允许后即开始实时监听。对着麦克风清晰说出唤醒词即可触发。

  5. 查看结果与日志:每次检测的「最新检测结果」会显示命中与否及置信度;成功触发后,记录会按时间倒序出现在「检测日志」中,包含唤醒词、触发时刻和置信度。检测完毕点「⏹ 停止监听」释放麦克风。

  6. 用音频文件离线测试(可选):在「本地音频测试」中点击「选择文件」上传一段含唤醒词的录音,工具会自动解码并转成 16kHz 单声道后完成一次检测,结果同样显示在「最新检测结果」中。

使用技巧

  • 先用「标准」预设打底:它兼顾灵敏度与误触,适合大多数室内环境;确认能稳定触发后再根据实际表现切到「高灵敏」或「低误触」。
  • 嘈杂环境优先「低误触」:该预设要求更高置信度且连续命中多次才触发,能显著减少电视声、人声闲聊带来的误报。
  • 灵敏度微调看百分比:滑杆下方会显示当前阈值,建议每次只调 5%–10%,边说边观察「最新检测结果」里的置信度变化,找到刚好能稳定触发的位置。
  • 换唤醒词后先测文件再开麦克风:模型原本针对「小云小云」训练,换成其他词识别率可能下降,建议先上传一段录音做离线测试,确认效果再实时监听。
  • 发音要清晰完整:触发依赖连续的语音帧识别,吐字不清、语速过快或背景噪声大都会拉低置信度,尽量正对麦克风、用正常语速完整说出唤醒词。
  • 长时间不用记得停止监听:监听会持续占用麦克风和一定的浏览器计算资源,不用时点击「停止监听」,既省电也能避免隐私指示灯常亮。

常见问题

Q1:用这个工具会把我的语音上传到服务器吗?
不会。音频全程在浏览器本地用 ONNX 模型处理,不会上传到任何服务器,页面上的隐私提示也明确说明了这一点;首次加载的约 3MB 模型会自动缓存到本地。

Q2:为什么点「开始监听麦克风」后浏览器弹出了权限提示?
实时监听需要访问麦克风,浏览器会弹出授权请求,必须点击「允许」才能开始。如果误点了「拒绝」,需要在浏览器地址栏的站点权限设置中重新允许麦克风访问。

Q3:几个检测预设有什么区别?
它们本质是三组参数的组合:置信度阈值、需要连续命中的次数和两次触发间的冷却时间。「高灵敏」阈值低、一次命中即触发;「低误触」阈值高、需连续命中三次;「标准」居中;「长词模式」对完整发音更稳定;「自定义」则由你手动调阈值。

Q4:为什么我说了唤醒词却没有触发?
常见原因有四个:阈值设得过高,可适当调低灵敏度;环境嘈杂或发音不清导致置信度不足;唤醒词跨分析窗被切断(工具已用 1 秒重叠窗缓解,但极快语速仍可能漏检);或麦克风实际没有输入,可检查系统音量和浏览器权限。

Q5:可以把唤醒词改成任意词吗?
不能随便改。唤醒词只能由模型词表中存在的字符组成,输入框会逐字符校验,遇到不支持的字符会报错;且模型原本针对「小云小云」训练,换成其他词即使能设置,识别率也可能下降。

Q6:「本地音频测试」支持哪些格式?
只要是浏览器能解码的音频(audio/*,如 MP3、WAV、M4A 等常见格式)都可以上传,工具会自动解码并统一转为 16kHz 单声道后再检测,无需自己预处理。