- 拖放或上传 Parquet 文件 — 将
.parquet二进制数据文件拖放到解析区,或点击选择本地文件。若无现成文件,可直接点击界面内置的三大生产级测试数据集。 - 检查列式结构与元数据 — 切换至结构模式与元数据面板,查看物理存储类型(
INT64、DOUBLE、BYTE_ARRAY)、逻辑类型及压缩算法(Snappy、Zstd、Gzip)。 - 数据网格检索与分页 — 在交互式表格中浏览数据,支持表头单机升降排序、全字段实时文本检索以及每页行数切换(25、50、100、250 行)。
- 运行本地 SQL 极速查询 — 在 SQL 查询控制台中输入标准 SQL 语句,支持
COUNT、SUM、AVG、GROUP BY与ORDER BY,毫秒级即时呈现统计结果。 - 多格式一键导出 — 将当前数据或 SQL 统计结果一键导出为标准 CSV、结构化 JSON、流式 NDJSON 或关系型 SQL INSERT 语句。
什么是浏览器端 Parquet 文件查看器与 SQL 查询工作台?
Parquet 文件查看器与浏览器 SQL 极速查询工作台 是一款专为数据工程师、算法研发人员、数据分析师打造的纯前端免安装工具。在当今现代大数据生态中,Apache Parquet 列式存储已成为云数据湖(AWS S3、Google Cloud Storage、阿里云 OSS)、新一代分析型数仓(Snowflake、Databricks、DuckDB、ClickHouse)以及大模型训练集(Hugging Face、PySpark、Polars)的核心底层格式。然而由于 Parquet 是二进制且经过深度压缩的列式文件,开发人员在排查数据时往往需要编写 Python 脚本或启动繁重的 Jupyter 环境。
本工具彻底打破这一工作流瓶颈。借助浏览器本地 WebAssembly 与 ArrayBuffer 内存调度机制,您只需将 .parquet 文件拖放至窗口中,即可零延迟查看列式 Schema、遍历每行数据、执行即时 SQL 统计并导出多种格式,全过程在本地沙箱中闭环运行。
列式存储架构的核心优势
在行式数据库中,即使只需要计算某一个字段的平均值,磁盘引擎也必须将整行记录的全部字段加载进内存。而 Apache Parquet 将同一字段的数据整齐存放于专属列块中,在运行 SUM 或 AVG 等聚合时仅针对对应列寻址,读取效率提升数倍至数十倍。
企业级离线隐私保障
工具承诺绝对的“零数据上传”安全标准。无论您的数据包含企业机密财务报表、用户行为日志还是敏感模型参数,所有计算均被锁定在当前浏览器标签页内。在打开本页面后,您甚至可以在断开外网的状态下完整使用所有查询与导出功能。