Saltar para o conteúdo

OCR PDF: reconhecer o texto de digitalizações

Reconhece o texto das páginas digitalizadas e acrescenta-o, invisível, por cima de cada página: o PDF fica igual, mas passa a dar para pesquisar e copiar o texto. Tudo acontece no teu dispositivo.

Processado no teu dispositivoNada é enviado para servidores

Arrasta um ou mais PDFs para aqui

Ficheiros PDF

Os ficheiros são abertos no teu dispositivo e nunca são enviados.

Como funciona

  1. Escolhe o PDF digitalizado

    Arrasta o ficheiro para a área de trabalho ou usa o botão. Podes escolher vários de uma vez.

  2. Escolhe as línguas

    Marca as línguas do documento (português, inglês ou espanhol) e a qualidade. Da primeira vez, o MovaDoc descarrega os dados do reconhecimento: cerca de 3 MB por língua.

  3. Descarrega o PDF pesquisável

    As páginas ficam iguais, com o texto reconhecido escondido por cima: já o podes pesquisar e copiar. Também podes descarregar só o texto (.txt).

Perguntas frequentes

Os meus ficheiros são enviados para algum servidor?

Não. O reconhecimento corre no teu browser, com o motor Tesseract. Da primeira vez, o MovaDoc descarrega do próprio site o motor e os dados das línguas (cerca de 3 MB por língua), quando começas a usar a ferramenta (tocas ou clicas nela, ou chegas a ela com o teclado) e antes de processar qualquer ficheiro; o teu PDF nunca sai do dispositivo.

O texto reconhecido fica certo?

Depende da digitalização. Texto impresso, nítido e direito reconhece-se quase sem erros; digitalizações tortas, desfocadas ou com pouca resolução dão mais erros. A escrita à mão não é reconhecida. Uma página digitalizada de lado tem de ser rodada primeiro (em «Organizar PDF»). Confirma sempre o que for importante.

O que muda no PDF?

O que se vê fica igual: o texto reconhecido é acrescentado, invisível, por cima de cada página, no sítio de cada palavra. Assim podes selecionar, copiar e procurar o texto. Nas tabelas, as palavras ficam pesquisáveis, mas o texto copiado perde a forma da tabela.

Funciona sem internet?

Sim, depois da primeira vez: os ficheiros do reconhecimento ficam guardados no browser (numa janela privada, só até a fechares). Da primeira vez (e quando escolhes outra língua ou outra qualidade), é preciso internet para os descarregar.

Que línguas reconhece? E «Rápido» ou «Preciso»?

Português, inglês e espanhol, também misturados no mesmo documento. «Rápido» é mais leve e chega para texto impresso nítido; «Preciso» reconhece melhor letras pequenas e digitalizações fracas, mas demora mais. Num computador, cada página demora alguns segundos; num telemóvel, pode demorar bastante mais.