Microdados do IBGE sem R nem SAS: abrir o TXT com o input do SAS
Os microdados da PNAD Contínua, do Censo e da POF chegam como um TXT enorme sem separador e sem cabeçalho: cada linha é uma sequência de números, e onde começa a idade ou a UF só o arquivo de layout diz. O IBGE publica esse layout como um script de leitura do SAS (o “input”) e, em várias pesquisas, também para o SPSS. Quem não usa R, Stata ou SAS costuma travar aqui. Esse mesmo script basta para transformar o TXT numa tabela.
Grátis para usar. O arquivo é lido em partes, no seu navegador — nada é enviado a servidor algum. Versão para Windows — 4.9 MB, sem instalação: detalhes. Pro — US$ 29 uma vez: preço.
O que baixar
- Os dados: o ZIP do trimestre, com um TXT dentro (por exemplo,
PNADC_012023.txt, algumas centenas de megabytes). - A documentação: dentro dela está o input do SAS — um arquivo como
input_PNADC_trimestral.txt(às vezes com extensão.sas) com linhas@0001 Ano $4. /* Ano de referência */— e o dicionário de variáveis em Excel.
Extraia os dois ZIPs. O que o aplicativo usa é o input; o dicionário continua útil para consultar o significado dos códigos.
Abrir
- Selecione os dois arquivos de uma vez — o TXT de dados e o input do SAS (ou o
.spsdo SPSS) — e arraste para a janela. - O input é reconhecido pelo conteúdo, mesmo com extensão
.txt, e o TXT de dados é lido por ele: cada variável na sua posição, com o nome do script (Ano,UF,V2007,V2009,V1028…). - Já abriu só os dados? Em “Leitura”, clique em “Usar layout de arquivo SAS/SPSS…” e escolha o input. Também dá para arrastar só o input sobre a aba aberta.
Variáveis marcadas com $ ficam como texto — UF e códigos não perdem zeros à esquerda —, as demais viram números; formatos como 8.2 (casas decimais implícitas) são respeitados, e um . isolado vira valor ausente. Os comentários ao lado de cada variável (ou os LABEL) viram rótulos: em “Buscar coluna…” (Ctrl+G) dá para procurar por “idade” em vez de lembrar que é V2009.
O que dá para fazer com isso
- Recortar: filtre uma UF, uma faixa de idade, uma condição de ocupação, e exporte só esse recorte para CSV ou Excel.
- Contar com o peso: na “Tabela dinâmica…”, a soma de
V1028porUFé a estimativa de pessoas de cada estado. Médias ponderadas e intervalos de confiança com o desenho amostral continuam sendo trabalho para R (pacote survey) ou Stata. - Levar para outra ferramenta: salve o recorte em Parquet ou CSV com cabeçalho e abra no Power BI, no Python ou no próprio Excel — veja CSV para Parquet.
Tamanho e limites
O TXT não é carregado inteiro: ele é percorrido uma vez para indexar as linhas, e as linhas são lidas sob demanda, como num CSV grande. Um trimestre da PNAD abre num computador comum.
Os rótulos de categoria (1 = Homem, 2 = Mulher) não são aplicados: o input do SAS não os traz. A exportação gratuita vai até 5.000 linhas por arquivo; para levar o arquivo inteiro, há o Pro (US$ 29, uma vez).
Perguntas frequentes
Funciona com o Censo, a POF e a PNAD antiga?
Sim, quando a pesquisa traz um input do SAS no formato @posição nome $largura. ou uma sintaxe DATA LIST do SPSS com as colunas de cada variável. O aplicativo lê exatamente esse trecho do script.
Preciso ter o SAS ou o SPSS instalado?
Não. O script é usado só como descrição do layout; nada é executado.
Os dados são enviados para algum lugar?
Não. O TXT é lido no navegador ou no programa instalado no seu computador.
Posso editar o TXT e salvar no mesmo layout?
Não: com o layout do SAS a tabela é só para leitura, porque entre as variáveis pode haver trechos que não foram lidos. Salve o resultado em CSV, Excel ou Parquet.
Grátis para usar. Seu arquivo não é enviado a nenhum servidor. Versão para Windows — 4.9 MB, sem instalação: detalhes. Pro — US$ 29 uma vez: preço.