训练分类模型
TextGO 可以训练机器学习模型,识别自定义文本类型。
什么是分类模型
TextGO 使用 TensorFlow.js 在应用的 WebView 中本地训练和运行模型:
- 无需后端:训练和推理均在本地完成
- 隐私安全:数据不会离开你的设备
- 实时推理:模型加载后可快速识别文本
- 轻量级:模型体积小,加载迅速
何时使用分类模型
适合使用模型的场景
✅ 复杂的文本模式
- 难以用正则表达式描述的文本模式
- 存在一定变化但整体规律相似的文本
✅ 拥有足够的训练数据
- 至少提供 3 个不重复的非空正样本;样本越丰富,效果通常越好
- 样本应覆盖主要变化
✅ 可以容忍少量误判
- 业务流程允许偶尔出现误判
- 适合模糊匹配
不适合使用模型的场景
❌ 简单而精确的模式
- 可以用正则表达式精确描述
- 电话号码、身份证号等固定格式
❌ 训练数据不足
- 少于 3 个有效且不重复的样本时无法训练
- 样本未覆盖主要变化
❌ 不能容忍任何误判
- 对准确性有严格要求的业务场景
创建分类模型
步骤 1:进入模型管理
- 打开“设置”>“分类模型”
- 点击“+”按钮打开“新增分类模型”窗口
步骤 2:基本信息
填写模型的基本信息:
类型名称(必填)
- 标识模型
- 建议使用描述性的名称
类型图标(可选)
- 点击当前类型图标打开图标选择窗口
- 可选择“内置图标”或“上传自定义 SVG”
步骤 3:准备训练数据
正向样本(必填)
正向样本是决定模型识别能力的关键。
数据格式:
- 每行输入一个样本
- 样本可以包含任意文本
- 空行会被忽略,重复样本会被去除
样本质量要求:
- ✅ 样本应覆盖文本的主要变化情况
- ✅ 样本应包含该类文本的典型特征
- ✅ 清理样本中的无关内容
- ❌ 避免提供完全相同的样本
- ❌ 避免包含错误或无效的样本
步骤 4:配置参数
基础参数
置信度阈值(必填,1%–99%)
- 默认值:50%
- 相似度大于等于该阈值的文本将被识别为该类型
- 调整建议:
- 提高阈值 → 匹配更严格,减少误判率
- 降低阈值 → 匹配更宽松,提高识别率

使用分类模型
训练完成的模型会出现在识别类型列表中:
- 打开“全局快捷键”
- 添加一条新规则
- 在“识别类型”中选择训练完成的模型
- 配置执行动作并保存