Saltar para o conteúdo

PDF digitalizado para texto

Numa digitalização, cada página é uma imagem do papel: não há texto para copiar. O reconhecimento de texto (OCR) lê as letras no teu dispositivo e dá-te o texto num ficheiro .txt, mais um PDF onde já o podes procurar.

Processado no teu dispositivoNada é enviado para servidores

Arrasta um ou mais PDFs para aqui

Ficheiros PDF

Os ficheiros são abertos no teu dispositivo e nunca são enviados.

Como funciona

  1. Escolhe a digitalização

    Arrasta o PDF digitalizado (ou uma fotografia de um documento guardada em PDF) para a área de trabalho, ou usa o botão.

  2. Confirma a língua

    A língua da página já vem escolhida; marca as outras que o documento tiver. Da primeira vez, o MovaDoc descarrega os dados do reconhecimento: cerca de 3 MB por língua.

  3. Descarrega o texto

    Vês o início do texto reconhecido no ecrã. Carrega em «Descarregar o texto (.txt)» para teres o texto todo, ou descarrega o PDF pesquisável.

Perguntas frequentes

Porque é que não consigo copiar o texto do meu PDF?

Porque é uma digitalização: cada página é uma imagem do papel, sem letras guardadas, e o leitor de PDF só vê uma fotografia. O OCR reconhece as letras dessa imagem e transforma-as em texto que podes copiar, editar e procurar.

O texto sai com a formatação do documento?

Não. O ficheiro .txt tem só o texto, linha a linha, com uma linha em branco entre parágrafos: sem tipos de letra, negrito, imagens nem a grelha das tabelas. Para um documento do Word que se edita com títulos, listas e tabelas, usa «PDF para Word», que também reconhece as páginas digitalizadas.

Funciona com fotografias de documentos e com escrita à mão?

Com fotografias guardadas em PDF, sim, se estiverem nítidas e direitas: quanto melhor a imagem, menos erros. Se a fotografia estiver em JPG ou PNG, junta-a primeiro num PDF com «Imagens para PDF». A escrita à mão não é reconhecida: os dados do reconhecimento só servem para texto impresso.

Posso tirar o texto de vários PDFs de uma vez?

Sim, em dois passos. Com vários PDFs, recebes um ZIP com os PDFs pesquisáveis (sem os ficheiros .txt). Depois, «Continuar com…» → «PDF para texto», que também trata vários ficheiros de uma vez, dá um .txt por PDF.

O documento é enviado para algum lado para ser lido?

Não. O reconhecimento corre no teu browser, com o motor Tesseract. Da primeira vez, o MovaDoc descarrega do próprio site o motor e os dados das línguas; depois, funciona até sem internet. O PDF e o texto reconhecido nunca saem do teu dispositivo.