Um CSV com um milhão de linhas: com o que abrir
O limite do Excel é de 1.048.576 linhas. Um arquivo com dois milhões de linhas abre exatamente pela metade, e o aviso é fácil de perder — o que é mais perigoso do que recusar a abertura.
Grátis para uso pessoal. Os arquivos são lidos em partes, no seu navegador — nada é enviado. Versão para Windows — 3.5 MB, sem instalação: detalhes. Para organizações — licença.
Primeiro, não perca dados
O principal perigo de um CSV grande não é ser difícil de abrir, mas ser fácil abri-lo parcialmente sem notar. Antes de calcular qualquer coisa, confirme que você vê o arquivo inteiro: compare o número de linhas da origem com o que você vê.
Uma forma rápida de obter a contagem exata de linhas sem abrir o arquivo: no Linux e no macOS, wc -l arquivo.csv; no PowerShell, (Get-Content arquivo.csv | Measure-Object -Line).Lines. Lembre que o cabeçalho também conta, e que uma quebra de linha dentro de um campo entre aspas infla o resultado.
As opções, expostas com honestidade
| Método | Quando serve | O que custa |
|---|---|---|
| Power Query no Excel | Você precisa agregar e montar uma tabela dinâmica | Os dados são carregados em um modelo e a memória cresce; navegar linha a linha é incômodo |
| Python + pandas | Um trabalho pontual, e alguém sabe escrever o código | O arquivo inteiro vai para a memória; um arquivo de 5 GB precisa de 15–20 GB de RAM |
| DuckDB | Você quer SQL sobre o arquivo e aceita uma linha de comando | Uma ótima escolha, mas uma ferramenta para quem escreve consultas |
| Um editor de texto (Notepad++, VS Code) | Espiar as primeiras linhas | Sem colunas, sem filtros, e se arrasta em um gigabyte |
| Um visualizador no navegador | Olhar, filtrar, conferir, exportar um subconjunto | Não substitui uma ferramenta de análise |
Se a tarefa soa como “olhar e achar”, não precisa de maquinário pesado. Se soa como “recalcular os números do ano”, precisa — e isso significa DuckDB ou um banco de dados.
Por que um CSV grande abre devagar
Um CSV não tem sumário. Para saber onde começa a milionésima linha, é preciso ler todas as anteriores: uma quebra de linha dentro de um campo entre aspas não encerra um registro, então “é só procurar por \n” não funciona.
Sobram duas abordagens. A primeira é ler o arquivo inteiro para a memória e depois trabalhar rápido (o pandas e o Excel fazem isso). A segunda é percorrer o arquivo uma vez, lembrar o deslocamento em que cada linha começa e ler as linhas em si sob demanda. O segundo caminho precisa de uma leitura sequencial e quase nenhuma memória: para dez milhões de linhas o índice ocupa uns 80 MB, enquanto os dados ficam no disco.
O Tabulens segue o segundo caminho — por isso um arquivo de um gigabyte abre em mais ou menos o tempo que o disco leva para lê-lo, e a rolagem não depende do tamanho.
O que mais quebra em arquivos grandes
- Linhas irregulares. Entre um milhão de linhas, quase certamente haverá uma dúzia com um delimitador a mais. Uma ferramenta deve avisar, não deslocar as colunas em silêncio.
- Codificações misturadas. Um arquivo costurado a partir de várias exportações pode conter trechos em codificações diferentes. O sinal é texto legível misturado com caracteres estragados.
- Quebras de linha dentro de campos. Endereços e observações muitas vezes têm quebras de linha. Ler sem considerar as aspas transforma um registro em dois.
Perguntas frequentes
Quantas linhas o Tabulens abre?
O limite é de 50 milhões de linhas por arquivo. Não há limite de tamanho de arquivo: só os registros visíveis são lidos.
Posso exportar parte de um CSV grande para o Excel?
Pode: aplique um filtro e exporte o resultado para XLSX. Lembre do limite do próprio formato, de 1.048.575 linhas de dados.
Um arquivo de 10 GB abre?
Abre, mas montar o índice de linhas exige uma leitura completa do arquivo — na prática é o tempo do disco, cerca de um minuto em um SSD rápido.
Grátis para uso pessoal. Seu arquivo não é enviado a nenhum servidor. Versão para Windows — 3.5 MB, sem instalação: detalhes. Para organizações — licença.