Как проверить, доступен ли для поиска текст внутри отсканированного вложения в дневнике
Если вы хотите найти старую запись в дневнике по слову, которое содержится в отсканированном вложении, выполните поиск по заведомо присутствующему слову, а затем убедитесь, что найденный результат указывает именно на вложение, а не на напечатанную заметку или имя файла. Скан может представлять собой просто изображение, PDF с существующим текстовым слоем или изображение, которое приложение должно обработать с помощью OCR. Это разные пути к поиску по тексту, и их поддержка зависит от приложения, типа файла, тарифного плана и устройства.
Что значит «доступный для поиска» применительно к вложению?
Успешный поиск в приложении может найти совпадение по нескольким разным элементам: напечатанному тексту заметки дневника, имени файла вложения, выделяемому тексту, уже встроенному в PDF, или словам, распознанным на изображении с помощью оптического распознавания символов (OCR). Сам по себе результат не показывает, какой именно путь привел к совпадению. Например, поиск слова «Станция» мало о чем говорит, если в самой заметке написано «Билет со станции» или файл называется `Station.pdf`.
Отсканированный PDF может выглядеть как обычный документ, но содержать только изображения страниц. Если вы не можете выделить печатное слово в программе для просмотра PDF, это признак того, что в PDF может отсутствовать текстовый слой; однако это не доказывает, способно ли ваше приложение для заметок выполнить OCR. И наоборот: выделяемый текст PDF может быть доступен для поиска без распознавания изображений. Проверьте файл в программе для просмотра PDF и протестируйте приложение отдельно.
Проведите контролируемый тест с известным словом
По возможности используйте копию вложения или тестовую заметку. Выберите характерное слово, отчетливо видное на скане, и убедитесь, что оно не встречается в заголовке заметки, напечатанном тексте или имени файла. Затем:
Это порядок действий, а не отчет о тестировании конкретной учетной записи. Отсутствие результата само по себе не является окончательным выводом: OCR может быть отключено, обработка может еще продолжаться, формат может не поддерживаться или на текущем устройстве может отсутствовать соответствующий индекс.
Сначала проверьте формат и текстовый слой
Зафиксируйте, в каком формате представлено вложение: JPEG/PNG, отсканированный PDF или PDF с выделяемым текстом. Затем ознакомьтесь с актуальной документацией приложения по поддержке каждого формата в отдельности. В [документации по OCR](https://joplinapp.org/help/apps/ocr/) приложения Joplin указано, что его система OCR сканирует изображения PNG и JPEG, а также файлы PDF, причем обработка изображений и PDF доступна в приложении для настольных компьютеров. Там также описана возможность просмотра текста OCR для ссылки на PDF или изображения. Это позволяет проверить как извлеченный текст, так и наличие в нем ожидаемого слова.
В [инструкциях по OCR для OneNote](https://support.microsoft.com/en-us/office/copy-text-from-pictures-and-file-printouts-using-ocr-in-onenote-93a70a2f-ebcd-42dc-9f0b-19b09fd775b4) от Microsoft описано копирование текста из изображений и распечаток файлов. Для многостраничной распечатки предлагается копирование с одной страницы или со всех страниц, а также содержится предупреждение, что получение некоторых результатов может занять 24–48 часов. Это относится к распознаванию и извлечению текста из изображений или распечаток OneNote; не следует предполагать, что любой прикрепленный файл обрабатывается точно так же.
Отделяйте возможности приложения от условий учетной записи и устройства
Приложение может поддерживать OCR в целом, но параметры вашей учетной записи, тарифного плана, настройки или конкретное устройство могут влиять на то, сработает ли это для определенного вложения. На [странице функций поиска](https://evernote.com/features/search) Evernote в настоящее время указано, что тарифы Personal, Professional и Enterprise поддерживают поиск текста в PDF, документах Office, изображениях, презентациях и отсканированных документах. Ознакомьтесь с актуальными условиями тарифов и параметрами собственного плана, прежде чем рассчитывать на эту возможность.
В Joplin описано еще одно важное различие: сканирование OCR выполняется в приложении для настольных компьютеров, тогда как мобильные приложения получают доступ к данным OCR через синхронизацию. Таким образом, отсутствие совпадения на телефоне не означает, что файл не может быть проиндексирован; сначала проверьте обработку на настольном компьютере и доступность синхронизированных данных. В целом сверяйте версию приложения, действующий тарифный план, настройки OCR, тип файла, статус обработки и состояние синхронизации с актуальной документацией. Не думайте, что загрузка файла автоматически извлекает из него текст или что каждое устройство формирует индекс локально.
Внимательно изучайте результат и выявляйте причины неудач
Если известное слово присутствует в тексте OCR приложения, но поиск не находит заметку, проблема, скорее всего, кроется дальше по цепочке поиска или синхронизации; сверьтесь с документацией по поиску приложения и повторите попытку после завершения обработки или синхронизации. Если в тексте OCR слово отсутствует, проверьте четкость скана, ориентацию, языковые настройки, а также то, является ли текст печатным или рукописным. Joplin отмечает, что его текущая система надежно работает с печатным текстом и четкими изображениями, но не поддерживает рукописный ввод; Microsoft также предупреждает, что эффективность OCR зависит от качества изображения. Таким образом, ошибки распознавания — вероятная причина отсутствия результата.
Если слово выделяется в PDF, но не находится через приложение для заметок, убедитесь, что приложение индексирует PDF со встроенным текстом так же, как и сканы, состоящие только из изображений. Если результаты выдаются только по имени файла или напечатанной заметке, это подтверждает, что эти поля доступны для поиска, но ничего не говорит о словах внутри вложения. Разделяйте эти проверки при фиксации результата.
Ведите краткий учет возможностей
Для каждого оцениваемого приложения фиксируйте само приложение и устройство, тарифный план (если применимо), формат вложения, выделяется ли слово в PDF, настройки OCR и статус обработки, состояние синхронизации, а также точный результат теста. Отмечайте, откуда поступил совпавший текст: из заметки, имени файла, существующего текстового слоя PDF или текста OCR. Это превратит ощущение «поиск вроде бы работает» в проверяемый тест, который можно повторить после смены устройства, тарифного плана, настроек или формата файлов.
