OCR PDF: reconhecer o texto de digitalizações
Reconhece o texto das páginas digitalizadas e acrescenta-o, invisível, por cima de cada página: o PDF fica igual, mas passa a dar para pesquisar e copiar o texto. Tudo acontece no teu dispositivo.
Processado no teu dispositivoNada é enviado para servidores
Arrasta um ou mais PDFs para aqui
Ficheiros PDF
Os ficheiros são abertos no teu dispositivo e nunca são enviados.
Como funciona
Escolhe o PDF digitalizado
Arrasta o ficheiro para a área de trabalho ou usa o botão. Podes escolher vários de uma vez.
Escolhe as línguas
Marca as línguas do documento (português, inglês ou espanhol) e a qualidade. Da primeira vez, o MovaDoc descarrega os dados do reconhecimento: cerca de 3 MB por língua.
Descarrega o PDF pesquisável
As páginas ficam iguais, com o texto reconhecido escondido por cima: já o podes pesquisar e copiar. Também podes descarregar só o texto (.txt).
Perguntas frequentes
Os meus ficheiros são enviados para algum servidor?
Não. O reconhecimento corre no teu browser, com o motor Tesseract. Da primeira vez, o MovaDoc descarrega do próprio site o motor e os dados das línguas (cerca de 3 MB por língua), quando começas a usar a ferramenta (tocas ou clicas nela, ou chegas a ela com o teclado) e antes de processar qualquer ficheiro; o teu PDF nunca sai do dispositivo.
O texto reconhecido fica certo?
Depende da digitalização. Texto impresso, nítido e direito reconhece-se quase sem erros; digitalizações tortas, desfocadas ou com pouca resolução dão mais erros. A escrita à mão não é reconhecida. Uma página digitalizada de lado tem de ser rodada primeiro (em «Organizar PDF»). Confirma sempre o que for importante.
O que muda no PDF?
O que se vê fica igual: o texto reconhecido é acrescentado, invisível, por cima de cada página, no sítio de cada palavra. Assim podes selecionar, copiar e procurar o texto. Nas tabelas, as palavras ficam pesquisáveis, mas o texto copiado perde a forma da tabela.
Funciona sem internet?
Sim, depois da primeira vez: os ficheiros do reconhecimento ficam guardados no browser (numa janela privada, só até a fechares). Da primeira vez (e quando escolhes outra língua ou outra qualidade), é preciso internet para os descarregar.
Que línguas reconhece? E «Rápido» ou «Preciso»?
Português, inglês e espanhol, também misturados no mesmo documento. «Rápido» é mais leve e chega para texto impresso nítido; «Preciso» reconhece melhor letras pequenas e digitalizações fracas, mas demora mais. Num computador, cada página demora alguns segundos; num telemóvel, pode demorar bastante mais.