浏览器本地表格工具

CSV 编码转换与乱码排查

从原始字节选择来源编码,保留文本结构,输出 UTF-8 新副本。在浏览器本地处理,核对结果后导出新副本。

文件内容在浏览器本地处理;刷新或关闭会清空会话。网页仍会请求静态资源。

1 选择原始文件2 确认规则3 审阅与交付
也可拖放到此处

先选择文件,再确认处理范围

原始输入仅保留在当前页面内存。刷新或关闭将清空;切换语言不会改动数据。

合成示例库 · 正常 / 边界 / 错误
仅当前页面内存 · 可取消 · 新副本输出 · 刷新或关闭清空

先找回正确的读取方式

CSV 编码转换处理的是字符与字节的对应方式。中文、日文或带重音的名称出现乱码时,应尽量选择系统最初导出的文件。已经用错误编码打开、覆盖保存的副本,可能把原字符替换成了问号或其他文字;再次转成 UTF-8 并不等于把丢失的信息找回来。

工作台在本页内存中保留原始字节。切换“来源编码”后,会重新读取原字节,不会把当前乱码预览当作新的来源。导出始终生成新副本,不覆盖设备上的原文件。粘贴入口也能使用,但剪贴板文字已被其他软件解码,不能用来判断原文件究竟采用了哪种编码。

逐份核对编码与结构

点击“选择文件”或拖入 CSV、TSV、文本文件。在“当前文件”中逐份选择,设置来源编码、分隔符、引用字符、是否有表头和预期字段数。点击“从原字节预览”,展开原始文本与字节片段,比较包含中文、日文或重音字符的片段,再勾选该文件的确认项。

编码候选不是正确性的保证。带字节顺序标记的文件可以提供较明确的建议;没有标记时,严格 UTF-8 解码通过也只是一条证据。某些传统编码能接受很多不同来源的字节,文字“能够显示”不代表选择正确。尽量同时核对导出软件的编码设置,不要只查看全是数字的行。

来源支持与 UTF-8 输出

支持的来源编码包括 UTF-8、带 BOM 的 UTF-8、UTF-16 小端与大端、Shift-JIS、GB18030 和 Windows-1252。如果浏览器不支持所选编码,或字节不符合该编码规则,页面会提示问题并停止严格转换。两份文件可分别选择不同来源编码,确认第一份不会替第二份作决定。

输出限定 UTF-8,可单独选择带 BOM。BOM 是文件开头的编码标记,不是 CSV 分隔符,也不是修复字符的算法。纯转码保留引号、逗号、制表符、空格、字段内换行及原记录换行方式,不默认重新序列化。文本中其他位置的正常字符不会因为外观相似而被删除。

一个完整的核对例子

合成数据中有编号 00123,以及包含“中文、日本語 café”和表情符号的描述。正确选择来源编码后,运行全量处理,检查报告,再校验并下载。重新按 UTF-8 解码的数据文件应保留相同文字;带引号字段中的逗号、双引号和换行也应保持原样。

开启 BOM 与关闭 BOM 的输出只应相差用户选择的开头标记。CSV 文件里的编号仍是 00123,但这不保证接收者双击后 Excel 一定按文本显示。目标软件的导入类型推断可能把它显示成 123;需要在接收软件中将编号列按文本导入。

区分编码失败、结构错误与有损输出

严格模式遇到无效字节会停止所选解码并保留来源。优先换一个有依据的来源编码,或让源系统重新导出。“明确允许替代无效字节”属于不可逆的有损选项,只有用户主动选择才使用,报告也会标明;出现替代符号不能被当作完整恢复。

解码正常的文件仍可能缺少引号或字段数不一致。结构检查独立报告这些问题,不因字符显示正确就宣称 CSV 已修复。用户明确接受结构警告时,可以导出保留原结构的 UTF-8 副本,再进入结构修复工具处理。引用边界不确定时,不给出虚构的完整记录数。

导出、继续处理与限制

“执行全量处理”针对完整所选输入;片段和网格分页只是展示。“校验导出并显示摘要”核对输出后,“确认下载新副本”下载编号命名的转换文件及编码报告 ZIP。纯转码不会添加公式防护单引号,公式样式文本仍保留原风险;需要防护时,应进入表格工具并明确选择导出设置。

可继续进入 CSV 结构修复或清洗,数据不放入网址。更改输入、编码或规则后,旧结果过期,必须重新运行。任务可取消;文件大小、累计体积、记录数、列数、单格长度及运行时间有上限。页面只在内存中保留会话,切换语言不改数据解释,刷新或关闭会清空。网页本身仍需通过网络加载静态资源。

常见问题

CSV 在别处正常,Excel 打开中文却乱码,怎么办?

先用原始文件检查编码,比较候选预览并确认文字正确,再导出 UTF-8 新副本。需要时选择 BOM,或在接收软件里明确指定编码。之前保存时已经被替换、丢失的字符,不能仅靠换编码恢复。

BOM 能解决所有乱码吗?

不能。BOM 帮助接收软件选择 UTF-8,但来源字节仍须正确解码。已经被覆盖保存成错误文字、问号或替代符号的内容,不一定能够恢复。

为什么选了不同编码,预览都没有报错?

不同编码可能接受相同字节。应查看有意义的词语,并核对源系统设置。严格通过只说明字节对解码器有效,不证明它就是原作者使用的编码。

转换会改变逗号或换行吗?

纯转码不改变解码后的文本结构。分隔符设置用于检查结构。需要改分隔符时,请另行明确解析和导出。

多文件必须使用同一种来源编码吗?

不需要。每份文件独立选择和确认;输出统一为 UTF-8,报告记录各自来源选择。