Blog Metlivi

Como verificar se o texto dentro de um anexo de diário digitalizado é pesquisável

Se você deseja encontrar uma entrada antiga de diário por uma palavra contida em seu anexo digitalizado, pesquise por uma palavra que você sabe que está lá e confirme se o resultado correspondente aponta para o anexo, e não para o texto digitado na nota ou para o nome do arquivo. Uma digitalização pode ser apenas uma imagem, um PDF com uma camada de texto existente ou uma imagem que o aplicativo precisa processar via OCR. Esses são caminhos diferentes para se obter texto pesquisável, e o suporte varia de acordo com o aplicativo, tipo de arquivo, plano e dispositivo.

30 de setembro de 20264 min de leituraEstética cotidiana e expressão pessoalPor Metlivi Editorial Team
Seção 1

O que significa “pesquisável” para um anexo?

Uma busca bem-sucedida no aplicativo pode coincidir com vários elementos diferentes: o corpo digitado da nota do diário, o nome do arquivo do anexo, o texto selecionável já incorporado em um PDF ou palavras reconhecidas em uma imagem por meio de reconhecimento óptico de caracteres (OCR). Um resultado, por si só, não indica qual caminho produziu a correspondência. Por exemplo, buscar por “Estação” prova muito pouco se a própria nota diz “Passagem da estação” ou se o arquivo se chama `Estacao.pdf`.

Um PDF digitalizado pode parecer um documento normal, mesmo contendo apenas imagens das páginas. Se você não conseguir selecionar uma palavra impressa em um visualizador de PDF, isso é um indício de que o PDF pode não ter uma camada de texto; não é uma prova do que o seu aplicativo de notas consegue processar via OCR. Por outro lado, um texto de PDF selecionável pode ser pesquisável sem a necessidade de reconhecimento de imagem. Verifique o arquivo em um visualizador de PDF e teste o aplicativo separadamente.

Seção 2

Faça um teste controlado com uma palavra conhecida

Use uma cópia do anexo ou uma nota descartável, se possível. Escolha uma palavra distinta e claramente visível dentro da digitalização e certifique-se de que essa palavra não apareça no título da nota, no corpo digitado ou no nome do arquivo. Em seguida:

Este é um procedimento, não o relato de teste de uma conta específica. Uma consulta sem resultados não é conclusiva por si só: o OCR pode estar desativado, o processamento ainda pode estar em andamento, o formato pode não ser compatível ou o dispositivo atual pode não ter o índice relevante.

Pesquise a palavra escolhida na interface de busca padrão do aplicativo.
Inspecione o resultado e verifique se ele identifica a nota por causa do anexo, caso o aplicativo indique o local da correspondência.
Abra o anexo. Se for um PDF, tente selecionar e copiar a palavra escolhida em um leitor de PDF.
Pesquise novamente por uma palavra diferente que apareça apenas na nota digitada. Compare a atribuição de cada resultado.
Se disponível, inspecione o texto reconhecido pelo OCR ou use a ação de OCR descrita na documentação do aplicativo. Confirme se a palavra escolhida foi realmente reconhecida, e não apenas deduzida a partir do resultado.
Seção 3

Verifique o formato e a camada de texto primeiro

Registre se o anexo é JPEG/PNG, um PDF digitalizado ou um PDF com texto selecionável. Em seguida, verifique a documentação de suporte atual do aplicativo para cada formato separadamente. A [documentação de OCR do Joplin](https://joplinapp.org/help/apps/ocr/) afirma que o seu OCR verifica imagens PNG e JPEG e arquivos PDF, e que o processamento de imagens e PDFs está disponível no aplicativo para desktop. Ela também descreve uma opção para visualizar o texto de OCR de um link de PDF ou imagem. Isso permite verificar tanto o texto extraído quanto a presença da palavra esperada nele.

As [instruções de OCR do Microsoft OneNote](https://support.microsoft.com/en-us/office/copy-text-from-pictures-and-file-printouts-using-ocr-in-onenote-93a70a2f-ebcd-42dc-9f0b-19b09fd775b4) descrevem como copiar texto de imagens e impressões de arquivos. Para uma impressão de várias páginas, as instruções oferecem a opção de copiar de uma única página ou de todas as páginas e alertam que alguns resultados podem levar de 24 a 48 horas. Isso descreve o reconhecimento e a extração de texto a partir de imagens ou impressões no OneNote; não presuma que todo tipo de arquivo anexado seja processado da mesma forma.

Seção 4

Separe o suporte do aplicativo das condições da conta e do dispositivo

Um aplicativo pode ter suporte geral a OCR, enquanto sua conta, plano, configurações ou dispositivo atual podem afetar o funcionamento para um anexo específico. A [página do recurso de busca do Evernote](https://evernote.com/features/search) informa atualmente que seus planos Personal, Professional e Enterprise podem pesquisar textos em PDFs, documentos do Office, imagens, apresentações e documentos digitalizados. Verifique os detalhes atualizados do plano e a sua própria assinatura antes de depender desse recurso.

O Joplin documenta outra distinção importante: a verificação por OCR é executada no aplicativo para desktop, enquanto os aplicativos móveis podem acessar os dados de OCR via sincronização. Portanto, a ausência de uma correspondência no celular não prova que o arquivo não pode ser indexado; primeiro verifique o processamento no desktop e se os dados sincronizados estão disponíveis. De modo geral, verifique a versão do aplicativo, o plano aplicável, a configuração de OCR, o tipo de arquivo, o status do processamento e o estado da sincronização em relação à documentação atual. Não presuma que o envio de um arquivo extrai automaticamente seu texto ou que todos os dispositivos criam um índice localmente.

Seção 5

Analise o resultado com atenção e diagnostique as falhas

Se a palavra conhecida constar no texto de OCR do aplicativo, mas a pesquisa não retornar a nota, o problema provavelmente está mais adiante no caminho de busca ou sincronização; consulte a documentação de pesquisa do aplicativo e repita após a conclusão do processamento ou da sincronização. Se o texto de OCR omitir a palavra, verifique a nitidez da digitalização, a orientação, as configurações de idioma e se o texto é impresso ou manuscrito. O Joplin afirma que seu sistema atual é confiável para texto impresso e imagens nítidas, mas não oferece suporte a manuscritos; a Microsoft também adverte que a eficácia do OCR depende da qualidade da imagem. Erros de reconhecimento são, portanto, uma causa provável para a ausência de resultados.

Se a palavra puder ser selecionada no PDF, mas não for encontrada por meio do aplicativo de notas, verifique se o aplicativo indexa PDFs com texto incorporado, bem como digitalizações compostas apenas por imagens. Se apenas o nome do arquivo ou a nota digitada gerarem resultados, isso confirma que esses campos são pesquisáveis, mas não diz nada sobre as palavras contidas no anexo. Mantenha essas verificações separadas ao registrar o resultado.

Seção 6

Mantenha um breve registro de recursos

Para cada aplicativo avaliado, anote o aplicativo e o dispositivo, o plano da conta (se aplicável), o formato do anexo, se a palavra no PDF é selecionável, a configuração de OCR e o status de processamento, o estado de sincronização e o resultado exato do teste. Registre se o texto correspondente veio da nota, do nome do arquivo, da camada de texto existente no PDF ou do texto de OCR. Isso transforma a impressão de que “a busca parece funcionar” em uma verificação reproduzível após mudar de dispositivo, plano, configurações ou formato de arquivo.

Leituras relacionadas

Continue explorando o tema