- Pegue los Datos o Cargue el Archivo — Inserte su texto CSV o arrastre un archivo .csv, .tsv o .txt.
- Revise el Dialecto Detectado — Compruebe el delimitador identificado, número de filas y columnas.
- Seleccione el Delimitador Destino — Elija coma estándar RFC 4180, punto y coma europeo, tabulador o barra.
- Active las Opciones de Reparación — Active la inyección de UTF-8 BOM para Excel y la corrección de Mojibake.
- Examine la Vista Previa — Revise la tabla dinámica interactiva con las primeras 100 filas formateadas.
- Descargue los Resultados — Exporte el archivo con BOM para Excel o en UTF-8 estándar para bases de datos.
¿Qué es el Normalizador de Delimitadores, Codificación y Dialectos CSV?
El formato CSV es el estándar universal de intercambio de datos tabulares, pero la falta de una especificación uniforme genera graves problemas de interoperabilidad entre Microsoft Excel, bases de datos relacionales SQL y entornos analíticos como Pandas en Python. Este estudio profesional permite resolver de forma automática, eficiente y completamente privada en el cliente los dos errores más comunes: el Mojibake (caracteres acentuados, letras eñes y alfabetos especiales corrompidos por diferencias de codificación) y el Desajuste de Delimitadores (archivos europeos con punto y coma que se abren en una sola columna en Excel).
Arquitectura de Detección de Dialectos e Inyección de BOM
Nuestra herramienta analiza estadísticamente los primeros bloques de caracteres para identificar con exactitud el delimitador dominante real respetando el entrecomillado. Mediante un autómata finito determinista (FSM) rigurosamente conforme a la norma RFC 4180, procesa campos multilínea con saltos de línea y alinea de manera consistente filas desiguales (ragged rows). Al activar la opción de BOM para Excel, antepone la firma de tres bytes \uFEFF que instruye a Excel a interpretar el archivo en UTF-8 puro, eliminando cualquier distorsión gráfica.
Ventajas Clave del Procesamiento Local
- Privacidad Absoluta: Los registros financieros, nóminas o bases de datos de clientes jamás salen de su navegador.
- Normalización Instantánea: Detección automática entre comas, puntos y comas, tabuladores TSV y barras verticales pipe.
- Reparación de Filas Desiguales: Rellena columnas faltantes para evitar errores de importación en PostgreSQL o MySQL.
- Generación de Código Pandas: Código listo para copiar y cargar sus datos con parámetros exactos de lectura.
Buenas Prácticas para Pipelines de Datos Empresariales
Utilice la versión con BOM para archivos destinados a usuarios de negocio en hojas de cálculo como Microsoft Excel y LibreOffice Calc, y la versión UTF-8 estándar limpia sin BOM para procesos ETL automatizados en servidores Linux, scripts de Python o almacenes de datos en la nube.