O que o OCR faz no seu PDF
OCR PDF significa reconhecimento óptico de caracteres: a ferramenta “lê” as letras que aparecem nas imagens de um documento escaneado. Quando você escaneia um contrato ou fotografa uma apostila, o resultado é um PDF feito de fotos. Você vê o texto, mas o computador não: não dá para pesquisar uma palavra, copiar um parágrafo ou selecionar um número.
Depois do OCR, o PDF continua exatamente com a mesma aparência. A diferença é que ganha uma camada de texto invisível por cima de cada página, alinhada com as palavras da imagem. Com isso você pode usar o “buscar” do leitor de PDF, selecionar trechos e copiar para outro documento.
Quando o OCR ajuda no dia a dia
É útil para quem estuda com material escaneado e quer achar um termo rápido antes de uma prova de concurso ou vestibular. Também para quem precisa copiar o número de um processo, um CPF ou um endereço de um documento digitalizado, sem digitar tudo de novo.
O OCR também prepara o arquivo para outras ferramentas. O “PDF para Word” e o “PDF para Excel” precisam de texto de verdade para funcionar; num PDF escaneado, eles não encontram nada. Faça o OCR primeiro e depois converta. Se você digitalizou o documento com o “Digitalizar para PDF”, este é o passo seguinte natural.
Como conseguir um resultado melhor
A precisão depende da qualidade do escaneamento. Imagens nítidas, bem iluminadas, retas e com resolução adequada dão um reconhecimento muito melhor. Fotos tremidas, com sombra, papel amassado ou letra muito pequena geram erros. Texto manuscrito costuma ser reconhecido com dificuldade.
Escolha o idioma certo: ele ajuda a reconhecer acentos, cedilha e palavras típicas. Se o documento mistura português e inglês, marque os dois. Por padrão, a ferramenta pula as páginas que já têm texto, o que economiza tempo em PDF que são em parte digitais e em parte escaneados.
Revise sempre o que for copiar. O OCR pode confundir letras parecidas, como “l” e “1” ou “O” e “0”, principalmente em números.
Se o escaneamento ficou torto ou com bordas escuras, vale corrigir antes. O “Digitalizar para PDF” permite ajustar as quatro pontas da foto com correção de perspectiva e aplicar o filtro preto e branco, que deixa o fundo mais limpo. Um documento reto e contrastado é lido com bem menos erros.
Tudo no seu navegador
O reconhecimento acontece no seu aparelho. O documento não é enviado para lugar nenhum. Na primeira vez que você usa um idioma, o navegador baixa do ConvertirDocs os dados de reconhecimento desse idioma, que têm alguns MB. Esse download traz só o “dicionário” do OCR; seu arquivo continua no seu aparelho. Como o processamento é local, documentos longos podem levar algum tempo, principalmente no celular. A barra de progresso mostra em que página está.