Pular para o conteúdo

OCR PDF: reconhecer o texto de documentos digitalizados

Reconheça o texto das páginas digitalizadas e adicione-o, invisível, sobre cada página: o PDF continua com a mesma aparência, mas o texto passa a poder ser pesquisado e copiado. Tudo acontece no seu dispositivo.

Processado no seu dispositivoNada é enviado para servidores

Arraste um ou mais PDFs para cá

Arquivos PDF

Os arquivos são abertos no seu dispositivo e nunca são enviados.

Como funciona

  1. Escolha o PDF digitalizado

    Arraste o arquivo para a caixa acima ou use o botão. Você pode escolher vários de uma vez.

  2. Escolha os idiomas

    Marque os idiomas do documento (português, inglês, espanhol, francês, alemão ou italiano) e a qualidade. Na primeira vez, o MovaDoc baixa os dados do reconhecimento: cerca de 3 MB por idioma.

  3. Baixe o PDF pesquisável

    As páginas continuam iguais, com o texto reconhecido oculto por cima: agora você pode pesquisá-lo e copiá-lo. Você também pode baixar só o texto (.txt).

Perguntas frequentes

Meus arquivos são enviados para algum servidor?

Não. O reconhecimento é feito no seu navegador, com o mecanismo Tesseract. Na primeira vez, o MovaDoc baixa do próprio site o mecanismo e os dados dos idiomas (cerca de 3 MB por idioma), quando você começa a usar a ferramenta (ao tocar ou clicar nela, ou ao chegar até ela com o teclado) e antes de processar qualquer arquivo; seu PDF nunca sai do dispositivo.

O texto reconhecido fica correto?

Depende da digitalização. Texto impresso, nítido e alinhado é reconhecido quase sem erros; digitalizações tortas, desfocadas ou com pouca resolução geram mais erros. Textos escritos à mão não são reconhecidos. Uma página digitalizada de lado precisa ser girada antes (em “Organizar PDF”). Sempre confira o que for importante.

O que muda no PDF?

A aparência continua igual: o texto reconhecido é adicionado, invisível, sobre cada página, na posição de cada palavra. Assim, você pode selecionar, copiar e pesquisar o texto. Nas tabelas, as palavras ficam pesquisáveis, mas o texto copiado perde o formato da tabela.

Funciona sem internet?

Sim, depois da primeira vez: os arquivos do reconhecimento ficam salvos no navegador (em uma janela anônima, só até você fechá-la). Na primeira vez (e quando você escolhe outro idioma ou outra qualidade), é preciso ter internet para baixá-los.

Quais idiomas ele reconhece? E “Rápido” ou “Preciso”?

Português, inglês, espanhol, francês, alemão e italiano, inclusive misturados no mesmo documento. “Rápido” é mais leve e suficiente para texto impresso nítido; “Preciso” reconhece melhor letras pequenas e digitalizações de baixa qualidade, mas demora mais. Em um computador, cada página leva alguns segundos; no celular, pode demorar bem mais.