# AI 智能标签/分类使用教程：本地 AI 自动打标签，文本分类不上传

> 来源：工具派（https://gjupai.com） 原文页面：https://gjupai.com/tutorial/ai-smart-tagging-guide

## 工具简介

**AI 智能标签/分类**是工具派推出的一款基于本地 AI 模型的文本分类工具：把文章、评论、商品描述等文本粘贴进去，点击一个按钮，AI 就会从候选标签库中自动挑出最贴切的分类标签，并为每个标签给出 0–100% 的置信度。它使用的是 `paraphrase-multilingual-MiniLM` 语义向量模型，模型文件已内置在项目内（约 113MB ONNX + 16MB Tokenizer），首次加载后由浏览器自动缓存，**全程在浏览器本地运行，文本不会上传到服务器**。你既可以使用内置的 63 个通用标签，也可以输入自己的候选标签，或一键套用博客、客服、产品、邮件四个场景预设。

## 功能亮点

- **纯本地运行，隐私安全**：文本仅在浏览器本地处理，不会上传到任何服务器，模型加载一次后由浏览器自动缓存，离线也能用，适合处理内部文档、客户反馈等敏感内容。
- **语义相似度打分**：不是简单的关键词匹配，而是把文本和每个候选标签都转成语义向量，再计算余弦相似度，按置信度从高到低排序，理解「意思相近但用词不同」的内容。
- **内置 63 个通用标签**：留空候选标签时自动使用覆盖科技、金融、教育、医疗、娱乐、体育、美食、职场、游戏等常见领域的通用标签库，开箱即用。
- **四个场景预设**：「博客标签」「客服分类」「产品类别」「邮件标签」四个预设按钮，一键填入针对该场景定制的候选标签，例如客服场景自动给出「售前咨询、售后问题、投诉建议」等分类。
- **支持自定义候选标签**：用逗号或换行分隔输入任意标签，AI 只在你给出的范围内挑选，适合做自有分类体系的内容打标。
- **推荐数量与阈值双滑杆**：「推荐数量」控制最多输出几个标签（1–10 个），「阈值」过滤掉置信度过低的标签（0–90%），结果多少、松紧程度完全可控。
- **文件上传与拖拽**：除了粘贴文本，还支持点击「上传文件」或把 `.txt`、`.md`、`.json`、`.csv`、`.log` 文件直接拖进输入框，自动读取前 5000 字进行分析。

## 参数说明

| 参数 | 说明 | 默认值 / 取值范围 |
| --- | --- | --- |
| 文本内容 | 待分析的文本，可粘贴、上传文件或拖拽文件到输入框，右下角实时显示字数 | 必填，最长 5000 字 |
| 上传文件 | 点击「上传文件」选择本地文本文件，自动填入文本框 | 支持 `.txt`、`.md`、`.json`、`.csv`、`.log`，文件不超过 1MB |
| 候选标签（可选） | 自定义候选标签，用逗号或换行分隔；留空则使用内置的 63 个通用标签库 | 默认留空（使用通用标签库） |
| 场景预设 | 一键填入定制候选标签 | 博客标签、客服分类、产品类别、邮件标签 |
| 推荐数量 | 最多输出的标签个数，按置信度从高到低取前 N 个 | 默认 5，范围 1–10 |
| 阈值 | 置信度下限，低于该值的标签不显示，单位为 % | 默认 20%，范围 0–90%，步长 5% |
| 生成标签 | 开始分析按钮，首次使用会先加载模型并显示加载进度条 | 按钮，分析中显示「分析中...」 |

## 使用步骤

1. **打开工具页面**：页面从上到下依次是工具标题与简介、隐私提示、文本输入区、候选标签区、参数滑杆和「生成标签」按钮，无需登录即可使用。

![AI 智能标签/分类主界面：顶部为工具标题与简介卡片，其下是蓝色隐私提示条（说明文本仅本地处理、模型约 113MB）；主](article/202607/1783997643364_4295.png)

2. **输入待分析文本**：在「文本内容」输入框中粘贴文章、评论或商品描述（最长 5000 字）；也可以点击右上角「上传文件」选择本地文件，或把 `.txt`、`.md`、`.json`、`.csv`、`.log` 文件直接拖进输入框，工具会自动读取文本内容（截取前 5000 字）。

3. **设置候选标签（可选）**：在「候选标签（可选）」输入框中用逗号或换行分隔输入你自己的标签；也可以直接点击下方的「博客标签」「客服分类」「产品类别」「邮件标签」预设一键套用。留空则使用内置的 63 个通用标签。

4. **调节推荐数量与阈值**：拖动「推荐数量」滑杆设置最多输出几个标签（默认 5 个）；拖动「阈值」滑杆设置置信度下限（默认 20%），低于阈值的标签会被过滤掉。

5. **点击「生成标签」**：首次使用时页面会显示「模型加载中」进度条（模型约 113MB，加载后浏览器自动缓存，之后再用就很快），随后会提示「正在计算候选标签语义向量...」，稍等片刻即可完成分析。

6. **查看推荐标签**：分析完成后，页面下方出现「推荐标签」结果区，每个标签以胶囊样式展示并附带置信度百分比（如「科技 87%」），按置信度从高到低排列，可直接把标签复制用到自己的内容管理系统中。

## 使用技巧

- **先用预设，再微调**：四个场景预设覆盖了最常见的打标需求，点一下预设按钮得到候选标签后，再在输入框里增删几个词，比从零手写标签高效得多。
- **标签越具体，结果越准**：自定义候选标签时用「人工智能、机器学习」这类具体词，比「技术」这种宽泛词更容易得到高置信度的准确结果。
- **结果太多就调高阈值**：如果输出的标签里夹杂着不太相关的结果，把阈值从 20% 调到 40% 以上，只保留高置信度标签；反过来觉得漏掉了标签，就把阈值调低。
- **长文截取关键段落**：模型对 5000 字以内的文本效果最好，超长文档建议只粘贴导语或核心段落，打标结果通常比全文更聚焦。
- **批量处理用拖拽文件**：整理一批 `.txt` 或 `.md` 文稿时，直接把文件一个个拖进输入框即可，省去反复复制粘贴的麻烦。
- **修改候选标签后会重新计算向量**：每次改动候选标签，工具都会重新计算标签的语义向量，所以确定好标签体系后再批量分析文本会更省时。

## 常见问题

**Q1：这个工具会把我的文本上传到服务器吗？**
不会。所有分析都在浏览器本地完成——模型加载到浏览器后，文本和标签的语义向量计算、相似度打分全部在本机进行，文本不会离开你的电脑，页面顶部的隐私提示也明确说明了这一点。

**Q2：第一次点击「生成标签」为什么要等一会儿？**
首次使用需要加载约 113MB 的 ONNX 模型和 16MB 的 Tokenizer，页面会显示「模型加载中」的进度条。加载完成后浏览器会自动缓存模型，之后再使用就无需重新下载，分析几乎是秒出结果。

**Q3：候选标签留空和自定义有什么区别？**
留空时使用内置的 63 个通用标签，覆盖科技、金融、教育、娱乐等常见领域，适合快速给内容分大类；自定义标签则只在你给出的范围内挑选，适合已有的分类体系，比如电商自己的商品类目、客服工单类型。

**Q4：置信度百分比是什么意思？**
置信度是文本与标签语义向量的余弦相似度换算成 0–100 的百分比，数值越高说明文本内容与该标签的语义越接近。它不是概率，而是「相关程度」的排序依据，页面结果区下方也有相应说明。

**Q5：支持上传哪些格式的文件？有大小限制吗？**
支持 `.txt`、`.md`、`.json`、`.csv`、`.log` 等文本文件，单个文件不超过 1MB，读取后自动截取前 5000 字填入文本框。其他格式（如 Word、PDF）需要先另存为文本文件再上传。

**Q6：为什么有时结果为空，一个标签都没有？**
说明所有候选标签的置信度都低于当前阈值。可以把「阈值」滑杆调低（比如调到 10% 或 0%），或者换一批更贴近文本内容的候选标签再试。

