Duplicatas em CSV: achar e resolver
Duplicatas raramente são cópias exatas. Mais frequentemente são dois registros sobre a mesma coisa que diferem por um espaço sobrando, pela caixa das letras ou por um campo preenchido — e é justamente por isso que sobrevivem a uma verificação de unicidade.
Três tipos de repetição
- Duplicatas completas — a linha inteira coincide. Em geral é resultado de carregar um arquivo duas vezes. Fácil de achar.
- Duplicatas por chave — o identificador coincide, o conteúdo difere. O caso mais perigoso: não está claro qual registro está certo.
- Duplicatas aproximadas — diferem na grafia: “Silva & Filhos Ltda.” e “SILVA E FILHOS LTDA”, “J. Silva” e “João Silva”. São difíceis de pegar automaticamente, mas a normalização resolve metade dos casos.
Como procurá-las
A ferramenta é o agrupamento. Agrupe por um campo candidato e acrescente uma medida “contagem”: tudo com contagem acima de um é repetição.
Se a chave é composta, agrupe por vários campos de uma vez. Combinações típicas: CPF ou CNPJ, e-mail, número do pedido + número do item, código do produto + depósito, cliente + competência.
Uma estimativa rápida sem agrupar: as estatísticas de uma coluna mostram o número de valores únicos. Se é menor que o número de linhas, há repetições com certeza, e você vê quantas de uma vez.
O caminho mais curto é a ferramenta “Duplicatas por campos”: marque os campos-chave, e as repetições aparecem lado a lado na tabela, com o número de grupos e de cópias excedentes.
Normalize antes de procurar
Antes de contar repetições, elimine as diferenças que não são repetições:
- espaços sobrando nas pontas — em arquivos DBF e exportações de sistemas antigos eles quase sempre existem;
- caixa das letras — em geral irrelevante para códigos e nomes;
- grafias diferentes de um mesmo valor:
(11) 91234-5678e11912345678, ou um CPF com e sem pontos.
Os dois primeiros são tratados pelas configurações de leitura e comparação. O terceiro exige uma expressão: agrupe não pelo próprio campo, mas pelo valor normalizado.
O que fazer depois
Achar as repetições é metade do trabalho; o resto é decidir qual registro está certo. Algumas abordagens que costumam funcionar:
- manter o mais recente pela data de modificação, se esse campo existir;
- manter o mais completo: um dos registros tem alguns campos vazios;
- conferir se os valores diferem: se diferem, não é duplicata, mas duas operações diferentes com o mesmo número — e a investigação pertence ao sistema de origem.
A lista filtrada de repetições pode ser exportada para um arquivo separado — em geral é isso que se entrega a quem é dono dos dados no sistema.
Perguntas frequentes
Posso apagar duplicatas direto no visualizador?
Pode. A ferramenta “Duplicatas por campos” mostra as repetições lado a lado e marca as cópias excedentes como excluídas, mantendo o registro mais antigo; as linhas marcadas ficam de fora ao salvar o CSV.
Como acho as linhas que faltam no segundo arquivo?
É uma comparação de duas tabelas por chave — veja como comparar dois arquivos CSV.
Quantas linhas o agrupamento aguenta?
O limite é de meio milhão de grupos distintos; o número de linhas de origem não importa.
Grátis para uso pessoal. Seu arquivo não é enviado a nenhum servidor. Versão para Windows — 3.5 MB, sem instalação: detalhes. Para organizações — licença.