跳转到内容

训练分类模型

TextGO 可以训练机器学习模型,识别自定义文本类型。

什么是分类模型

TextGO 使用 TensorFlow.js 在应用的 WebView 中本地训练和运行模型:

  • 无需后端:训练和推理均在本地完成
  • 隐私安全:数据不会离开你的设备
  • 实时推理:模型加载后可快速识别文本
  • 轻量级:模型体积小,加载迅速

何时使用分类模型

适合使用模型的场景

复杂的文本模式

  • 难以用正则表达式描述的文本模式
  • 存在一定变化但整体规律相似的文本

拥有足够的训练数据

  • 至少提供 3 个不重复的非空正样本;样本越丰富,效果通常越好
  • 样本应覆盖主要变化

可以容忍少量误判

  • 业务流程允许偶尔出现误判
  • 适合模糊匹配

不适合使用模型的场景

简单而精确的模式

  • 可以用正则表达式精确描述
  • 电话号码、身份证号等固定格式

训练数据不足

  • 少于 3 个有效且不重复的样本时无法训练
  • 样本未覆盖主要变化

不能容忍任何误判

  • 对准确性有严格要求的业务场景

创建分类模型

步骤 1:进入模型管理

  1. 打开“设置”>“分类模型”
  2. 点击“+”按钮打开“新增分类模型”窗口

步骤 2:基本信息

填写模型的基本信息:

类型名称(必填)

  • 标识模型
  • 建议使用描述性的名称

类型图标(可选)

  • 点击当前类型图标打开图标选择窗口
  • 可选择“内置图标”或“上传自定义 SVG”

步骤 3:准备训练数据

正向样本(必填)

正向样本是决定模型识别能力的关键。

数据格式

  • 每行输入一个样本
  • 样本可以包含任意文本
  • 空行会被忽略,重复样本会被去除

样本质量要求

  • ✅ 样本应覆盖文本的主要变化情况
  • ✅ 样本应包含该类文本的典型特征
  • ✅ 清理样本中的无关内容
  • ❌ 避免提供完全相同的样本
  • ❌ 避免包含错误或无效的样本

步骤 4:配置参数

基础参数

置信度阈值(必填,1%–99%)

  • 默认值:50%
  • 相似度大于等于该阈值的文本将被识别为该类型
  • 调整建议:
    • 提高阈值 → 匹配更严格,减少误判率
    • 降低阈值 → 匹配更宽松,提高识别率

TextGO 分类模型编辑窗口

使用分类模型

训练完成的模型会出现在识别类型列表中:

  1. 打开“全局快捷键”
  2. 添加一条新规则
  3. 在“识别类型”中选择训练完成的模型
  4. 配置执行动作并保存

基于 GPLv3 开源协议发布