Extraia texto de digitalizações e fotografias
Um documento digitalizado é uma imagem de texto, por isso copiar, pesquisar e selecionar não funcionam. O OCR volta a ler os carateres. Obtém o texto simples ou o mesmo documento com uma camada de texto invisível, para que se comporte como um PDF normal.
- PDF digitalizados e fotografias, até 200 páginas
- Sete idiomas, incluindo russo, japonês e chinês
- O PDF pesquisável mantém as páginas exatamente com o aspeto original
- Os ficheiros são eliminados automaticamente — 24 horas no plano gratuito, 7 dias nos planos pagos
PDF, PNG, JPG, TIFF, BMP, GIF, WebP ou HEIC.
Escolha o idioma que está realmente na página. O idioma errado não dá erro — devolve disparates.
Como extrair texto de uma digitalização
- 01
Carregue a digitalização ou a fotografia
Escolha um PDF digitalizado ou uma imagem da página. Os PDF com várias páginas são lidos página a página, por ordem.
- 02
Escolha o idioma
Selecione o idioma em que o documento está efetivamente escrito. Isto é mais importante do que parece: o idioma errado não gera um erro, gera disparates com um ar convincente.
- 03
Escolha texto simples ou PDF pesquisável
O texto simples dá-lhe os carateres para copiar. O PDF pesquisável devolve as páginas originais com uma camada de texto oculta, pelo que o ficheiro continua com o mesmo aspeto, mas pode ser pesquisado e selecionado.
- 04
Leia ou transfira o resultado
O texto aparece na página pronto a copiar; um PDF pesquisável é transferido de imediato.
O que afeta a precisão
Resolução. As páginas são processadas a 300 DPI antes da leitura, o nível recomendado pela própria documentação do Tesseract. Uma fotografia tirada de longe, ou uma digitalização feita a 100 DPI, dá menos material ao motor para trabalhar.
Alinhamento e foco. Uma página fotografada de lado, ou em que o texto se curva junto à lombada de um livro, é lida bastante pior do que uma digitalização plana.
Idioma. Cada idioma tem o seu próprio modelo treinado. Passar texto em cirílico ou japonês pelo modelo inglês devolve disparates de aspeto fluente em vez de um erro, e é por isso que o seletor só apresenta os idiomas que o servidor consegue realmente carregar.
O que o OCR não faz. A disposição não é preservada: colunas, tabelas e cabeçalhos regressam como texto corrido, por ordem de leitura. Se o PDF original já tiver uma camada de texto, a conversão para texto usa essa camada — exata, imediata e melhor do que qualquer OCR.
Para que é usado
Contratos e faturas
Um PDF assinado que chegou digitalizado, transformado num ficheiro pesquisável para que seja possível encontrar um número de referência mais tarde.
Recibos fotografados com o telemóvel
Extraia os valores e as datas de uma fotografia em vez de os escrever outra vez.
Documentos antigos e arquivos
Registos em papel digitalizados há anos, tornados pesquisáveis sem alterar o aspeto das páginas.
Capturas de ecrã e diapositivos
Recupere o texto de uma imagem quando o ficheiro original já desapareceu há muito.
Perguntas frequentes
O que é um PDF pesquisável?
Um PDF exatamente igual à digitalização que carregou, com uma camada invisível de texto reconhecido posicionada sobre as palavras. As páginas mantêm-se visualmente inalteradas, mas passa a poder selecioná-las, copiá-las e pesquisá-las, tal como outro software.
Que idiomas são suportados?
Inglês, russo, francês, alemão, espanhol, japonês e chinês simplificado. O seletor lista exatamente o que o servidor consegue carregar — nunca oferece um idioma que produzisse disparates em silêncio.
Quantas páginas consegue processar?
Até 200 páginas por ficheiro. Cada página é processada e lida separadamente, pelo que um documento longo demora proporcionalmente mais tempo.
O OCR é suficientemente preciso para se confiar nele?
Para uma digitalização limpa e direita de texto impresso, é muito preciso. Escrita manual, fotografias de baixa resolução, páginas inclinadas e tipos de letra invulgares dão resultados consideravelmente piores. Verifique sempre os números que interessam — as falhas de OCR parecem texto plausível, não erros.
Guardam o meu documento?
Não mais do que a retenção do seu plano: 24 horas no plano gratuito e para visitantes sem conta, 7 dias nos planos pagos. O ficheiro é transferido por TLS e não é usado para nada além de produzir o seu resultado.
O meu PDF já tem texto selecionável. Preciso de OCR?
Não. Se um PDF já tiver uma camada de texto, a conversão para texto usa essa camada diretamente, o que é exato e imediato. O OCR só é executado quando não há nada para extrair — ou seja, quando a página é mesmo apenas uma imagem.