浏览器本地表格工具

两张表的模糊匹配

按编辑距离生成候选,人工确认一对一或多对一映射。在浏览器本地处理,核对结果后导出新副本。

文件内容在浏览器本地处理;刷新或关闭会清空会话。网页仍会请求静态资源。

1导入数据—2设置规则—3检查结果—4导出副本

把表格放在这里

拖放 CSV、TSV 或分隔文本文件

UTF-8 · 每份最多 10 MB

从现有数据开始

文件内容在浏览器内处理,不上传至服务器。
仅保存在本页内存 · 切换工具可继续使用 · 刷新或关闭会清除会话CSV / TSV · UTF-8
合成示例库 · 正常 / 边界 / 错误

清除本页会话?

这会释放已导入数据、处理步骤与结果。请先导出需要保留的副本。原始文件不受影响。

找到可能对应项,保留人工判断

两张表的模糊匹配用于名称拼写不一致、精确键关联无法解决的情况。例如 Notebok 接近 Notebook,可以作为候选,但不代表软件已经认定二者是同一商品。默认输出只有用户接受的映射,待审阅和拒绝的候选不会自动进入后续整合。

可靠编号存在时应优先使用精确键关联。模糊分数只说明文字相似,不是客户、公司或产品身份一致的概率。常见姓名可能属于多人,一字之差也可能代表不同型号;业务背景不能由编辑距离替代。

导入两表和对应文本字段

先选择来源文件并确认解析,再通过“添加文件”导入目标表。分别选择主表与补充表 B,再指定来源文本字段和目标文本字段。两表行数和结构可以不同,其他编号、地址、备注等原始文本保留,供审阅时核对。

比较字段应描述可比对象,例如商品名对商品名。把公司名与整段地址比较也可能得到分数,但未必回答有意义的问题。报告为两侧保留来源文件和逻辑记录位置;这些是会话中的定位信息,不把姓名当成永久实体编号。

先精确比较,再生成近似候选

引擎先按配置的字符预处理建立精确匹配。若两个目标都叫 Notebook,两条都展示,不任取第一个。精确文字也需要用户接受,因为同名不等于同一实体。没有精确候选的来源再在允许范围内进行模糊比较。

算法版本为 levenshtein-nfc-codepoint-v1。先做 Unicode NFC,再按码点计算编辑距离,插入、删除、替换代价均为一;分数为 100×(1−距离/较长文本长度)。Notebok 与 Notebook 相差一次插入,较长长度八,分数 87.5。固定规则便于复现,不包含翻译、缩写扩展或语义理解。

阈值、预处理和附加限制

可选忽略大小写、去两端空格,原文仍保留。NFC 统一规范等价的重音表示,但不自动删除标点或改变词序。阈值 0–100 只筛选候选,不自动确认;默认每条最多三条模糊候选,可在显示范围内调整。同分按稳定来源顺序展示,不随机选中。

“添加必须相同字段”可限制国家、分类等对应列,支持多项严格相等。空文本不与空文本形成身份匹配,附加限制字段为空也不形成共同候选组。报告区分空键、限制范围内无目标、以及低于阈值。应先核对这些原因,再决定是否有依据放宽限制。

接受、拒绝、手动指定与撤销

运行后审阅列表显示双方原文、字符差异、分数、精确或近似类别、来源位置。接受和拒绝都是明确决定;可撤销,也可按待审、接受、拒绝筛选。决定改变后旧导出过期,需要重新运行生成一致的确认报告。

“手动指定对应记录”可以使用报告中的来源记录标识和目标记录表中的标识。手工选择可以在模糊候选展示数以外指定目标,但仍须满足空值和附加字段限制。报告会注明这是你手动选择的对应关系。换输入、改变相关字段或规则后,原确认需要重新核对。

一对一冲突不能静默覆盖

默认一对一模式中,不允许两条来源同时确认到同一目标,也不允许一条来源确认到多个目标。多对一模式明确允许多个来源共用一个目标,但每条来源仍只对应一个目标。重复或相反的导入决定由引擎阻断。

来源 Notebok、Notebook 都接近唯一目标 Notebook。接受第一条后,第二条再次尝试接受会显示一对一冲突,需要撤销或修正原决定,不能随机覆盖。如果业务确实确认来源重复,可明确选择多对一并重新审阅。

让确认关系进入精确键整合

“主结果内容”可选已确认映射,或“已确认实体明细”。映射记录双方位置和原始名称;实体明细将已接受的来源与目标按相同表头对齐,并增加共同的 _confirmed_entity 键。多对一时目标只加入一次,拒绝或待审候选完全不加入。

应用实体明细到工作流后,可进入“合并重复记录中的有效字段”,选择该明确键分组,再单独审阅电话、地址及名称冲突。接受名称对应关系不代表批准覆盖冲突字段。完成后可以继续验证必填和唯一性。两表字段合并后过宽会阻止实体输出,但单纯映射模式不受未请求的实体扩张影响。

导出、预算和会话

可导出确认映射、候选、接受与拒绝、无候选和设置;实体明细需选择对应主结果模式。报告记录算法版本与口径,生成 CSV/TSV 后重新解析校验。保存规则会包含当前决定,重新载入到输入时清除输入相关批准并要求复核,避免旧确认转移到新实体。

最多比较五万候选对、五百万字符工作量,每个比较文本最多 256 码点,并受共享任务时间限制。精确索引避免无用的全表编辑距离比较。超限时应增加可靠限制或缩小输入,不暗中抽样冒充全量。样本明确标注,取消释放工作线程并保留输入,刷新或关闭清空本页内存。

常见问题

两张表里的公司名称差几个字,能找出可能对应的记录吗?

可以按所选字段生成近似候选,并用合适的限定字段缩小范围。需要逐项确认,名称相似不能证明是同一家公司。先检查有歧义的记录,以及需要一对一还是多对一关系,再下载已确认结果。

阈值怎样选?

结合固定分数定义审阅有代表性的正确和错误候选。阈值只控制文字相似筛选,没有某个分数能保证实体相同。

两边名称完全一样,还需要确认吗?

不会。精确候选也需确认,同名的多个目标必须同时展示。

可以两条来源对应同一目标吗?

只有明确选择多对一才允许。一对一会阻止冲突;两种模式都不允许一条来源接受多个目标。

加载以前的匹配规则,为什么还要重新确认候选?

决定绑定具体输入和规则。相同表头不能证明新文件的实体就是原实体,因此载入时清除旧批准供重新审阅。