Pular para o conteúdo

PDF escaneado para texto

Em um PDF escaneado, cada página é uma imagem do papel: não há texto para copiar. O reconhecimento de texto (OCR) lê as letras no seu dispositivo e entrega o texto em um arquivo .txt, além de um PDF pesquisável.

Processado no seu dispositivoNada é enviado para servidores

Arraste um ou mais PDFs para cá

Arquivos PDF

Os arquivos são abertos no seu dispositivo e nunca são enviados.

Como funciona

  1. Escolha o PDF escaneado

    Arraste o PDF digitalizado (ou a foto de um documento salva em PDF) para a caixa acima, ou use o botão.

  2. Confirme o idioma

    O idioma da página já vem selecionado; marque os outros que o documento tiver. Na primeira vez, o MovaDoc baixa os dados do reconhecimento: cerca de 3 MB por idioma.

  3. Baixe o texto

    O início do texto reconhecido aparece na tela. Clique em “Baixar o texto (.txt)” para ter o texto completo, ou baixe o PDF pesquisável.

Perguntas frequentes

Por que não consigo copiar o texto do meu PDF?

Porque ele foi escaneado: cada página é uma imagem do papel, sem letras salvas, e o leitor de PDF só enxerga uma foto. O OCR reconhece as letras dessa imagem e as transforma em texto que você pode copiar, editar e pesquisar.

O texto mantém a formatação do documento?

Não. O arquivo .txt tem só o texto, linha por linha, com uma linha em branco entre os parágrafos: sem fontes, negrito, imagens nem a grade das tabelas. Para ter um documento do Word editável, com títulos, listas e tabelas, use “PDF para Word”, que também reconhece páginas digitalizadas.

Funciona com fotos de documentos e com textos escritos à mão?

Com fotos salvas em PDF, sim, se estiverem nítidas e retas: quanto melhor a imagem, menos erros. Se a foto estiver em JPG ou PNG, transforme-a primeiro em PDF com “Imagens para PDF”. Textos escritos à mão não são reconhecidos: os dados do reconhecimento só servem para texto impresso.

Posso extrair o texto de vários PDFs de uma vez?

Sim, em dois passos. Com vários PDFs, você recebe um ZIP com os PDFs pesquisáveis (sem os arquivos .txt). Depois, “Continuar com…” → “PDF para texto”, que também processa vários arquivos de uma vez, gera um .txt por PDF.

O documento é enviado para algum lugar para ser lido?

Não. O reconhecimento roda no seu navegador, com o mecanismo Tesseract. Na primeira vez, o MovaDoc baixa do próprio site o mecanismo e os dados dos idiomas; depois, funciona até sem internet. O PDF e o texto reconhecido nunca saem do seu dispositivo.