Texto e arquivos

Extrair Tabelas do PDF

Transforme tabelas de PDFs em CSV ou XLSX por posição de caractere — com prévia do resultado. Tudo no navegador, sem upload do documento.

  • sem upload
  • CSV e XLSX
  • grátis

Quando converter PDF em planilha

Tabela de uma nota fiscal eletrônica que você precisa em Excel. Extrato bancário em PDF com linhas que começam a virar planilha de controle. Especificações de produto com tabela de dimensões que precisam entrar num catálogo. Em todos esses casos, copiar cada célula à mão é o caminho longo — o extractor paginado economiza o trabalho.

Como funciona (e o limite da heurística)

O pdfjs expõe cada caractere do PDF com suas coordenadas (x, y) na página. A ferramenta agrupa caracteres em linhas (mesmo Y aproximado) e em colunas (gaps significativos entre posições X). O resultado é uma grade bidimensional que devient a tabela. Para documentos bem estruturados — NFes, contas, extratos — funciona bem.

Para PDFs digitalizados (imagem sem texto embutido), não há posição de caractere nenhuma para trabalhar. Nesse caso a via é OCR: a ferramenta OCR de imagem extrai texto de uma imagem convertida antes via PDF para JPG. Não é a mesma coisa que extração de tabela, mas é o melhor caminho alternativo para digitalizações.

Por que “sem upload” muda tudo

Serviços como iLovePDF "PDF para Excel" e Adobe online enviam o PDF para a nuvem e devolvem o XLSX. Aqui, todo o parsing acontece no seu navegador, em memória. A planilha resultante é gerada localmente. Importante para extratos com número de conta e saldo, notas fiscais com CNPJ de cliente, especificações com preços e margem de produto. Nada disso sai da sua máquina.

## faq

Perguntas frequentes

O PDF é enviado para algum servidor?

Não. O PDF é lido em memória pelo navegador, a posição dos caracteres é analisada e a tabela é reconstruída localmente. Não há upload, não há fila, não há cópia em nuvem — útil para notas fiscais, contas, extratos com dados sensíveis.

Quando funciona bem?

PDFs com tabelas bem formadas, originados digitalmente (não digitalizados): notas fiscais eletrônicas, extratos bancários em PDF, contas de energia, especificações de produto. A detecção usa a posição geográfica de cada caractere na página, agrupando por coordenadas — funciona quando a posição é significativa.

Quando NÃO funciona?

PDFs digitalizados (sem texto embutido) não têm o que detectar — use nosso OCR antes. Tabelas com células mescladas, quebras de coluna em múltiplas páginas e layouts complexos (matrizes com linhas de diferentes alturas) vão gerar resultados imprecisos; vale revisão manual.

CSV ou XLSX?

CSV é a escolha quando você vai importar para Google Sheets, Numbers, LibreOffice Calc ou um banco de dados. XLSX é melhor para enviar a alguém que vai abrir direto no Microsoft Excel. Os dois preservam o número de colunas e linhas.

Funciona com PDFs protegidos por senha?

Não. Detectamos e avisamos, mas não tentamos decriptar — não seria honesto. Se você tem a senha, abra o PDF no seu leitor, salve uma cópia sem senha e traga aqui.

## outras ferramentas