PDF digitalizado para texto
Numa digitalização, cada página é uma imagem do papel: não há texto para copiar. O reconhecimento de texto (OCR) lê as letras no teu dispositivo e dá-te o texto num ficheiro .txt, mais um PDF onde já o podes procurar.
Processado no teu dispositivoNada é enviado para servidores
Arrasta um ou mais PDFs para aqui
Ficheiros PDF
Os ficheiros são abertos no teu dispositivo e nunca são enviados.
Como funciona
Escolhe a digitalização
Arrasta o PDF digitalizado (ou uma fotografia de um documento guardada em PDF) para a área de trabalho, ou usa o botão.
Confirma a língua
A língua da página já vem escolhida; marca as outras que o documento tiver. Da primeira vez, o MovaDoc descarrega os dados do reconhecimento: cerca de 3 MB por língua.
Descarrega o texto
Vês o início do texto reconhecido no ecrã. Carrega em «Descarregar o texto (.txt)» para teres o texto todo, ou descarrega o PDF pesquisável.
Perguntas frequentes
Porque é que não consigo copiar o texto do meu PDF?
Porque é uma digitalização: cada página é uma imagem do papel, sem letras guardadas, e o leitor de PDF só vê uma fotografia. O OCR reconhece as letras dessa imagem e transforma-as em texto que podes copiar, editar e procurar.
O texto sai com a formatação do documento?
Não. O ficheiro .txt tem só o texto, linha a linha, com uma linha em branco entre parágrafos: sem tipos de letra, negrito, imagens nem a grelha das tabelas. Para um documento do Word que se edita com títulos, listas e tabelas, usa «PDF para Word», que também reconhece as páginas digitalizadas.
Funciona com fotografias de documentos e com escrita à mão?
Com fotografias guardadas em PDF, sim, se estiverem nítidas e direitas: quanto melhor a imagem, menos erros. Se a fotografia estiver em JPG ou PNG, junta-a primeiro num PDF com «Imagens para PDF». A escrita à mão não é reconhecida: os dados do reconhecimento só servem para texto impresso.
Posso tirar o texto de vários PDFs de uma vez?
Sim, em dois passos. Com vários PDFs, recebes um ZIP com os PDFs pesquisáveis (sem os ficheiros .txt). Depois, «Continuar com…» → «PDF para texto», que também trata vários ficheiros de uma vez, dá um .txt por PDF.
O documento é enviado para algum lado para ser lido?
Não. O reconhecimento corre no teu browser, com o motor Tesseract. Da primeira vez, o MovaDoc descarrega do próprio site o motor e os dados das línguas; depois, funciona até sem internet. O PDF e o texto reconhecido nunca saem do teu dispositivo.