Cómo comprobar si el texto dentro de un archivo adjunto escaneado de un diario admite búsquedas
Si desea encontrar una entrada antigua de su diario mediante una palabra que aparece dentro de su archivo adjunto escaneado, busque una palabra que sepa con certeza que está allí y luego confirme que el resultado coincidente apunte al archivo adjunto y no a la nota escrita o al nombre del archivo. Un escaneo puede ser simplemente una imagen, un PDF con una capa de texto existente o una imagen que la aplicación debe procesar mediante OCR. Estas son vías diferentes para obtener texto con capacidad de búsqueda, y la compatibilidad varía según la aplicación, el tipo de archivo, el plan y el dispositivo.
¿Qué significa que un archivo adjunto «admita búsquedas»?
Una búsqueda exitosa en la aplicación puede coincidir con varios elementos diferentes: el cuerpo escrito de la nota del diario, el nombre del archivo adjunto, texto seleccionable ya incrustado en un PDF o palabras reconocidas a partir de una imagen mediante reconocimiento óptico de caracteres (OCR). Un resultado por sí solo no muestra qué vía produjo la coincidencia. Por ejemplo, buscar «Estación» demuestra muy poco si la nota misma dice «Boleto de estación» o si el archivo se llama `Station.pdf`.
Un PDF escaneado puede parecer un documento normal y, al mismo tiempo, contener únicamente imágenes de páginas. Si no puede seleccionar una palabra impresa en un visor de PDF, es un indicio de que el PDF podría carecer de una capa de texto; no es una prueba de lo que su aplicación de notas puede procesar con OCR. Por el contrario, el texto seleccionable de un PDF puede admitir búsquedas sin necesidad de reconocimiento de imágenes. Revise el archivo en un visor de PDF y pruebe la aplicación por separado.
Haga una prueba controlada con una palabra conocida
Utilice una copia del archivo adjunto o una nota desechable si es posible. Elija una palabra distintiva claramente visible dentro del escaneo y asegúrese de que esa palabra no aparezca en el título de la nota, el cuerpo escrito o el nombre del archivo. Luego:
Este es un procedimiento, no un informe de prueba de una cuenta en particular. Una consulta fallida no es concluyente por sí misma: el OCR puede estar deshabilitado, el procesamiento aún puede estar en curso, un formato puede no ser compatible o el dispositivo actual puede no tener el índice correspondiente.
Compruebe primero el formato y la capa de texto
Registre si el archivo adjunto es JPEG/PNG, un PDF escaneado o un PDF con texto seleccionable. Luego revise la documentación de soporte actual de la aplicación para cada formato por separado. La [documentación de OCR de Joplin](https://joplinapp.org/help/apps/ocr/) indica que su OCR escanea imágenes PNG y JPEG, así como archivos PDF, y que el procesamiento de imágenes y PDF está disponible en la aplicación de escritorio. También describe una opción para ver el texto de OCR de un enlace a PDF o imagen. Esto permite verificar tanto el texto extraído como si la palabra esperada aparece en él.
Las [instrucciones de OCR de OneNote](https://support.microsoft.com/en-us/office/copy-text-from-pictures-and-file-printouts-using-ocr-in-onenote-93a70a2f-ebcd-42dc-9f0b-19b09fd775b4) de Microsoft describen cómo copiar texto de imágenes y copias impresas de archivos. Para una copia impresa de varias páginas, las instrucciones ofrecen la opción de copiar de una sola página o de todas las páginas, y advierten que algunos resultados pueden tardar entre 24 y 48 horas. Eso describe el reconocimiento y la extracción de texto a partir de imágenes o copias impresas de OneNote; no asuma que todos los tipos de archivos adjuntos se procesan de la misma manera.
Distinga entre el soporte de la aplicación y las condiciones de la cuenta y del dispositivo
Una aplicación puede admitir OCR en general, mientras que su cuenta, plan, configuración o dispositivo actual influyen en si funciona para un archivo adjunto en particular. La [página de funciones de búsqueda de Evernote](https://evernote.com/features/search) indica actualmente que sus planes Personal, Professional y Enterprise pueden buscar texto en archivos PDF, documentos de Office, imágenes, presentaciones y documentos escaneados. Revise los detalles actualizados de los planes y su propio plan antes de dar por sentada esa funcionalidad.
Joplin documenta otra distinción importante: el escaneo por OCR se ejecuta en su aplicación de escritorio, mientras que las aplicaciones móviles pueden acceder a los datos de OCR a través de la sincronización. Por lo tanto, el hecho de que no haya coincidencia en un teléfono no demuestra que el archivo no se pueda indexar; primero verifique el procesamiento en el escritorio y si los datos sincronizados están disponibles. De manera más general, verifique la versión de la aplicación, el plan aplicable, la configuración de OCR, el tipo de archivo, el estado del procesamiento y el estado de sincronización con la documentación actual. No asuma que subir un archivo extrae automáticamente su texto ni que todos los dispositivos crean un índice localmente.
Lea el resultado detenidamente y diagnostique las omisiones
Si la palabra conocida aparece en el texto OCR de la aplicación pero la búsqueda no muestra la nota, es probable que el problema se encuentre más adelante en la ruta de búsqueda o sincronización; revise la documentación de búsqueda de la aplicación y repita la prueba una vez finalizado el procesamiento o la sincronización. Si el texto OCR omite la palabra, inspeccione la claridad del escaneo, la orientación, la configuración de idioma y si la escritura es impresa o manuscrita. Joplin afirma que su sistema actual es confiable para texto impreso e imágenes claras, pero no admite escritura a mano; Microsoft también advierte que la efectividad del OCR depende de la calidad de la imagen. Por lo tanto, los errores de reconocimiento son una causa plausible de una omisión.
Si la palabra se puede seleccionar en el PDF pero no se encuentra mediante la aplicación de notas, verifique que la aplicación indexe tanto los archivos PDF con texto incrustado como los escaneos que solo contienen imágenes. Si solo el nombre del archivo o la nota escrita activan resultados, eso confirma que esos campos admiten búsquedas, pero no dice nada sobre las palabras dentro del archivo adjunto. Mantenga estas comprobaciones por separado al registrar el resultado.
Lleve un breve registro de capacidades
Para cada aplicación que evalúe, anote la aplicación y el dispositivo, el plan de la cuenta si corresponde, el formato del archivo adjunto, si la palabra del PDF es seleccionable, la configuración de OCR y el estado de procesamiento, el estado de sincronización y el resultado exacto de la prueba. Registre si el texto coincidente provino de la nota, del nombre del archivo, de la capa de texto existente del PDF o del texto de OCR. Esto transforma un «parece que la búsqueda funciona» en una verificación que puede repetir después de cambiar de dispositivo, de plan, de configuración o de formato de archivo.
