Duplicados en CSV: encontrarlos y ordenarlos
Los duplicados rara vez son copias exactas. Lo más frecuente es que sean dos registros sobre lo mismo que difieren en un espacio suelto, en las mayúsculas o en un campo relleno, y precisamente por eso sobreviven a una comprobación de unicidad.
Tres clases de repeticiones
- Duplicados completos: coincide toda la línea. Suele ser el resultado de cargar un archivo dos veces. Fáciles de encontrar.
- Duplicados por clave: coincide el identificador, el contenido difiere. El caso más peligroso: no está claro qué registro es el correcto.
- Duplicados difusos: difieren en la ortografía, como «Acme S.L.» y «ACME, SL», o «J. García» y «Juan García». Son difíciles de captar de forma automática, pero la normalización elimina la mitad de los casos.
Cómo buscarlos
La herramienta es la agrupación. Agrupe por un campo candidato y añada una medida de «recuento»: todo lo que tenga un recuento superior a uno es una repetición.
Si la clave es compuesta, agrupe por varios campos a la vez. Combinaciones típicas: correo, número de pedido + número de línea, referencia + almacén, cliente + periodo de facturación.
Una estimación rápida sin agrupar: las estadísticas de una columna muestran el número de valores únicos. Si es menor que el número de filas, hay repeticiones seguro, y se ve cuántas de golpe.
El camino más corto es la herramienta «Duplicados por campos»: marque los campos clave y las repeticiones aparecen juntas en la tabla, con el número de grupos y de copias sobrantes.
Normalizar antes de buscar
Antes de contar repeticiones, quite las diferencias que no son repeticiones:
- espacios sueltos en los extremos: en los archivos DBF y en las exportaciones de sistemas antiguos casi siempre los hay;
- mayúsculas y minúsculas: normalmente irrelevantes en códigos y nombres;
- distintas grafías de un mismo valor:
+34 600 123 456y34600123456.
De los dos primeros se encargan los ajustes de lectura y de comparación. El tercero necesita una expresión: agrupe no por el propio campo sino por el valor normalizado.
Qué hacer después
Encontrar repeticiones es la mitad del trabajo; el resto es decidir qué registro es el correcto. Algunos enfoques que suelen funcionar:
- conservar el más reciente por fecha de modificación, si existe ese campo;
- conservar el más completo: uno de los registros tiene algunos campos vacíos;
- comprobar si los importes difieren: si es así, no es un duplicado sino dos operaciones distintas con el mismo número, y la investigación corresponde al sistema de origen.
La lista filtrada de repeticiones se puede exportar a un archivo aparte; normalmente eso es lo que se pasa a quien gestiona los datos en el sistema.
Preguntas frecuentes
¿Puedo eliminar los duplicados en el propio visor?
Sí. La herramienta «Duplicados por campos» muestra las repeticiones juntas y marca las copias sobrantes para eliminarlas, conservando el registro más antiguo; las filas marcadas se dejan fuera al guardar el CSV.
¿Cómo encuentro las filas que faltan en el segundo archivo?
Es una comparación de dos tablas por clave: vea cómo comparar dos archivos CSV.
¿Cuántas filas aguanta la agrupación?
El límite es de medio millón de grupos distintos; el número de filas de origen no importa.
Gratis para usar. Su archivo no se sube a ningún servidor. Versión para Windows — 4.6 MB, sin instalación: detalles. Pro — 29 USD una sola vez: precio.