OCR

Extraia texto de digitalizações e fotografias

Um documento digitalizado é uma imagem de texto, por isso copiar, pesquisar e selecionar não funcionam. O OCR volta a ler os carateres. Obtém o texto simples ou o mesmo documento com uma camada de texto invisível, para que se comporte como um PDF normal.

  • PDF digitalizados e fotografias, até 200 páginas
  • Sete idiomas, incluindo russo, japonês e chinês
  • O PDF pesquisável mantém as páginas exatamente com o aspeto original
  • Os ficheiros são eliminados automaticamente — 24 horas no plano gratuito, 7 dias nos planos pagos

PDF, PNG, JPG, TIFF, BMP, GIF, WebP ou HEIC.

Escolha o idioma que está realmente na página. O idioma errado não dá erro — devolve disparates.

Resultado

O texto reconhecido, pronto a copiar.

Como extrair texto de uma digitalização

  1. 01

    Carregue a digitalização ou a fotografia

    Escolha um PDF digitalizado ou uma imagem da página. Os PDF com várias páginas são lidos página a página, por ordem.

  2. 02

    Escolha o idioma

    Selecione o idioma em que o documento está efetivamente escrito. Isto é mais importante do que parece: o idioma errado não gera um erro, gera disparates com um ar convincente.

  3. 03

    Escolha texto simples ou PDF pesquisável

    O texto simples dá-lhe os carateres para copiar. O PDF pesquisável devolve as páginas originais com uma camada de texto oculta, pelo que o ficheiro continua com o mesmo aspeto, mas pode ser pesquisado e selecionado.

  4. 04

    Leia ou transfira o resultado

    O texto aparece na página pronto a copiar; um PDF pesquisável é transferido de imediato.

O que afeta a precisão

Resolução. As páginas são processadas a 300 DPI antes da leitura, o nível recomendado pela própria documentação do Tesseract. Uma fotografia tirada de longe, ou uma digitalização feita a 100 DPI, dá menos material ao motor para trabalhar.

Alinhamento e foco. Uma página fotografada de lado, ou em que o texto se curva junto à lombada de um livro, é lida bastante pior do que uma digitalização plana.

Idioma. Cada idioma tem o seu próprio modelo treinado. Passar texto em cirílico ou japonês pelo modelo inglês devolve disparates de aspeto fluente em vez de um erro, e é por isso que o seletor só apresenta os idiomas que o servidor consegue realmente carregar.

O que o OCR não faz. A disposição não é preservada: colunas, tabelas e cabeçalhos regressam como texto corrido, por ordem de leitura. Se o PDF original já tiver uma camada de texto, a conversão para texto usa essa camada — exata, imediata e melhor do que qualquer OCR.

Para que é usado

Contratos e faturas

Um PDF assinado que chegou digitalizado, transformado num ficheiro pesquisável para que seja possível encontrar um número de referência mais tarde.

Recibos fotografados com o telemóvel

Extraia os valores e as datas de uma fotografia em vez de os escrever outra vez.

Documentos antigos e arquivos

Registos em papel digitalizados há anos, tornados pesquisáveis sem alterar o aspeto das páginas.

Capturas de ecrã e diapositivos

Recupere o texto de uma imagem quando o ficheiro original já desapareceu há muito.

Perguntas frequentes

O que é um PDF pesquisável?

Um PDF exatamente igual à digitalização que carregou, com uma camada invisível de texto reconhecido posicionada sobre as palavras. As páginas mantêm-se visualmente inalteradas, mas passa a poder selecioná-las, copiá-las e pesquisá-las, tal como outro software.

Que idiomas são suportados?

Inglês, russo, francês, alemão, espanhol, japonês e chinês simplificado. O seletor lista exatamente o que o servidor consegue carregar — nunca oferece um idioma que produzisse disparates em silêncio.

Quantas páginas consegue processar?

Até 200 páginas por ficheiro. Cada página é processada e lida separadamente, pelo que um documento longo demora proporcionalmente mais tempo.

O OCR é suficientemente preciso para se confiar nele?

Para uma digitalização limpa e direita de texto impresso, é muito preciso. Escrita manual, fotografias de baixa resolução, páginas inclinadas e tipos de letra invulgares dão resultados consideravelmente piores. Verifique sempre os números que interessam — as falhas de OCR parecem texto plausível, não erros.

Guardam o meu documento?

Não mais do que a retenção do seu plano: 24 horas no plano gratuito e para visitantes sem conta, 7 dias nos planos pagos. O ficheiro é transferido por TLS e não é usado para nada além de produzir o seu resultado.

O meu PDF já tem texto selecionável. Preciso de OCR?

Não. Se um PDF já tiver uma camada de texto, a conversão para texto usa essa camada diretamente, o que é exato e imediato. O OCR só é executado quando não há nada para extrair — ou seja, quando a página é mesmo apenas uma imagem.