- 导入 CSV 数据或上传文件 — 粘贴 CSV 文本源码或将 .csv、.tsv、.txt 数据文件拖入上传区域。
- 检查自动嗅探结果 — 查看实时诊断面板识别出的原始分隔符、数据行数、列数及编码特征。
- 选择目标分隔符与格式 — 选择目标分隔符(标准逗号 RFC 4180、欧洲分号、制表符 TSV 或管道符)与换行符。
- 勾选自动化修复选项 — 开启注入 UTF-8 BOM以确保 Excel 完美显示中文,勾选修复乱码与补齐缺损行。
- 预览规整后的动态表格 — 在可滚动的数据表格中查看前 100 行清晰对齐的格式化数据。
- 导出合规数据文件 — 下载带 Excel UTF-8 BOM 的 CSV、纯净标准 UTF-8 CSV、导出 JSON 数组或复制 Python Pandas 读取代码。
什么是 CSV 分隔符、编码与方言规范化修复工作台?
CSV 是跨系统数据交换中最通用的文本格式,但缺乏统一强制规范导致各类软件导出的文件方言五花八门。本项目专为数据分析师与软件工程师打造,旨在纯本地沙箱中彻底解决两类最顽固的数据缺陷:乱码问题(Mojibake 与缺失 Excel UTF-8 BOM)以及分隔符错位(欧洲分号导致全表堆积在 A 列)。
基于前端有限状态机的方言嗅探与 BOM 注入架构
工具首先在抽样字符中统计各候选分隔符的有效命中率,排除双引号包裹区域的干扰,精确识别源方言特征。通过内置的 RFC 4180 状态机解析器,平滑处理字段内换行符并自动对齐长短不一的缺损行。在导出时按需注入 \uFEFF 签名,彻底解决桌面端 Excel 打开中文及多语言时的乱码困扰。
企业级数据管道处理最佳实践
针对需要分发给业务团队在 Excel 中查阅的报表,务必勾选注入 UTF-8 BOM;而针对直接导入 Linux 服务器、PostgreSQL 或 Snowflake 的自动化 ETL 脚本,推荐导出无 BOM 的标准 UTF-8 格式以避免多余的字节噪声。