$ pdf --tabelas --csv
Texto e arquivosExtrair Tabelas do PDF
Transforme tabelas de PDFs em CSV ou XLSX por posição de caractere — com prévia do resultado. Tudo no navegador, sem upload do documento.
- sem upload
- CSV e XLSX
- grátis
Quando converter PDF em planilha
Tabela de uma nota fiscal eletrônica que você precisa em Excel. Extrato bancário em PDF com linhas que começam a virar planilha de controle. Especificações de produto com tabela de dimensões que precisam entrar num catálogo. Em todos esses casos, copiar cada célula à mão é o caminho longo — o extractor paginado economiza o trabalho.
Como funciona (e o limite da heurística)
O pdfjs expõe cada caractere do PDF com suas coordenadas (x, y) na página. A ferramenta agrupa caracteres em linhas (mesmo Y aproximado) e em colunas (gaps significativos entre posições X). O resultado é uma grade bidimensional que devient a tabela. Para documentos bem estruturados — NFes, contas, extratos — funciona bem.
Para PDFs digitalizados (imagem sem texto embutido), não há posição de caractere nenhuma para trabalhar. Nesse caso a via é OCR: a ferramenta OCR de imagem extrai texto de uma imagem convertida antes via PDF para JPG. Não é a mesma coisa que extração de tabela, mas é o melhor caminho alternativo para digitalizações.
Por que “sem upload” muda tudo
Serviços como iLovePDF "PDF para Excel" e Adobe online enviam o PDF para a nuvem e devolvem o XLSX. Aqui, todo o parsing acontece no seu navegador, em memória. A planilha resultante é gerada localmente. Importante para extratos com número de conta e saldo, notas fiscais com CNPJ de cliente, especificações com preços e margem de produto. Nada disso sai da sua máquina.
## faq
Perguntas frequentes
O PDF é enviado para algum servidor?
Não. O PDF é lido em memória pelo navegador, a posição dos caracteres é analisada e a tabela é reconstruída localmente. Não há upload, não há fila, não há cópia em nuvem — útil para notas fiscais, contas, extratos com dados sensíveis.
Quando funciona bem?
PDFs com tabelas bem formadas, originados digitalmente (não digitalizados): notas fiscais eletrônicas, extratos bancários em PDF, contas de energia, especificações de produto. A detecção usa a posição geográfica de cada caractere na página, agrupando por coordenadas — funciona quando a posição é significativa.
Quando NÃO funciona?
PDFs digitalizados (sem texto embutido) não têm o que detectar — use nosso OCR antes. Tabelas com células mescladas, quebras de coluna em múltiplas páginas e layouts complexos (matrizes com linhas de diferentes alturas) vão gerar resultados imprecisos; vale revisão manual.
CSV ou XLSX?
CSV é a escolha quando você vai importar para Google Sheets, Numbers, LibreOffice Calc ou um banco de dados. XLSX é melhor para enviar a alguém que vai abrir direto no Microsoft Excel. Os dois preservam o número de colunas e linhas.
Funciona com PDFs protegidos por senha?
Não. Detectamos e avisamos, mas não tentamos decriptar — não seria honesto. Se você tem a senha, abra o PDF no seu leitor, salve uma cópia sem senha e traga aqui.
## outras ferramentas