管理一个字段的标准值
分类值、品牌与状态标准化把同一字段的不同表达映射为用户确认的标准值。例如将“完成”“已完成”统一成“已完成”,但不能因为文字相近就认定两个品牌同属一家,也不能把两个客户姓名自动视为同一实体。本工具管理值域,跨表实体关系需在模糊匹配工具中另行审阅。
分类变化会影响后续分组与统计,所以每个映射都需要明确来源和目标。操作按完整值匹配,不做宽泛的子串替换;选择“完成”不会改变“完成中”。未映射值保留原样,界面语言切换也不翻译单元格数据。
查看不同值、次数与来源
通过选择文件或粘贴表格导入并确认解析,再选择“分类值字段”。左侧展示全部不同值及次数,默认按频次降序,支持搜索和分页。分页只控制当前显示,不限制实际不同值计数或映射覆盖范围。
大小写、空白、重音和标点默认严格保留。罕见值可能是拼写错误,也可能是合法的细分类别,不能只因为次数少就删除。运行后的不同值报告可点击来源,查看具体记录中的其他字段和上下文,帮助判断是否应统一。
手动选择并确认映射
选中一个或多个来源值,填写“目标标准值”,点击“确认选中值映射”。按钮显示这些值会影响多少条观察。已确认映射逐项列出,可改目标、移除或重新确认;修改目标会清除该项的确认,防止把旧批准用于新目标。
一个来源对应多个目标时阻止运行,且检查不依赖规则数组顺序。未确认的冲突映射也需整理后再运行。删除某条来源映射就能把它从原标准化组拆开;应用后的整步变换还可以通过工作流撤销。
映射只对原值应用一次
假设规则 A→B、B→C,同时输入 A 和 B。一次运行后,原 A 得到 B,原 B 得到 C,不会把刚产生的 B 再自动替换成 C。这样每个输出都对应用户明确审阅的原值映射,而不是隐式连续替换链。
同一未变化输入与规则重复运行结果一致。如果主动把输出应用到工作流,再对这份新输入运行同样规则,那是另一个明确步骤,可能继续改变 B。应区分重新预览与再次应用;有误操作时可撤销到前一步。
标准词表与历史映射
“标准词表与历史映射”中可以逐行填写允许的标准词,空白表示不限。配置词表后,确认目标不在词表中会阻止执行。词表只约束输出,不会自动推断每个来源该对应哪一个标准值。
导入两列映射表时,先通过“添加文件”走共享解析确认,再选择映射文件,第一列是来源、第二列是目标。“载入映射供逐项确认”将其作为未确认规则加入。也可保存和载入完整规则文件,新文件仍需核对字段。规则与词表可能包含敏感内容,分享前检查。
相似候选只是逐对建议
“生成相似值建议”默认关闭。启用后使用固定归一化编辑距离:Unicode NFC、按码点比较,插入、删除、替换代价均为一。分数为一减距离与较长文本长度的比值,再乘一百。它表示文字相似,不是同义概率或品牌关系概率。
每对候选独立确认。“确认左值映射到右值”只接受当前方向,随后可在设置中修改目标并重新确认。A 接近 B、B 接近 C 不会自动传递成三者同组;需要缩写、翻译或业务同义关系时,必须由用户根据来源决定。
完整例子与新值处理
输入“完成”“已完成”“完成中”,只选前两种,目标填“已完成”。结果前两条都是“已完成”,第三条仍是“完成中”。映射报告列出每条来源、目标和影响数量,同值映射可能没有实际单元格变化,这仍是有效结果。
新文件出现“待复核”而旧规则没有该值时,它保持原文并进入未映射记录。工具不会选最近的旧分类。先检查新值是否应加入标准词表,确实已知含义后再添加映射。复用规则节省重复工作,但不代表新值已经被批准。
导出与后续统计
可导出标准化表、标准值映射、全部不同值、未映射记录、相似建议和设置摘要。视图搜索不改变导出范围,修改映射会让旧结果过期。确认结果后应用到工作流,可继续概况、分组或透视;下游应重新统计,不能沿用标准化前的汇总。
CSV/TSV 生成后重新读取校验。公式防护可能影响以特殊前缀开始的目标文字,需明确选择。相似比较最多五万对、五百万字符工作量、每个文本最多 256 码点,这些是防护上限而非所有设备的速度承诺。过大值域可关闭建议并手动映射,或先明确缩小范围。样本带 SAMPLE 标识,取消保留输入,刷新或关闭清空会话。
常见问题
同一个品牌或状态写法不一致,怎么统一?
先查看不同值,把确认属于同一含义的写法映射到标准名称。相似建议只是帮助找候选,不应把实际不同的类别合在一起。下次复用词表时,继续检查没有映射的新值。
标准化和翻译是一回事吗?
不是。这里执行用户明确批准的完整值映射,不推断翻译,也不随界面语言修改单元格。
文字很像为什么不能自动合并?
编辑距离只比较字符,不理解产品、品牌和业务状态。高分只能作为候选线索。
旧词表遇到新分类怎么办?
新值保留原文并进入未映射记录,需要检查其含义后再决定映射或扩充词表。
如何拆开一个已选标准化组?
移除该来源值的映射,或修改目标并重新确认后运行;已应用整步也可撤销。