Skip to content

OCR

OCR извлекает текст из изображений, сканов и снимков экранов документов.

После распознавания можно скопировать результат, экспортировать его как Markdown, PDF или Word, либо упаковать несколько форматов вместе для скачивания.

Что может OCR

ВозможностьОписание
Распознавание текста на изображенияхИзвлекает текст из изображений, снимков экрана и сканов.
Распознавание макета документаЛучше подходит для таблиц, формул, печатей и смешанных макетов с текстом и изображениями.
Несколько сервисовПоддерживает Baidu PaddleOCR, Microsoft Azure Vision и Google Vision.
Копирование результатовКопирует распознанный текст после обработки.
Экспорт файловЭкспортирует Markdown, PDF и Word.
Пакетная упаковкаПосле распознавания нескольких файлов позволяет скачать результаты одним пакетом.

Сначала настройте сервисы OCR

Откройте:

text
System Settings -> Other Settings -> OCR

IP-геолокация и OCR

Заполните учетные данные для сервисов, которые хотите использовать:

СервисЧто указатьЛучше всего подходит для
Baidu PaddleOCRPaddleOCR TokenРекомендуемый первый вариант. Хорошо подходит для документов, изображений, таблиц и смешанных макетов.
Microsoft Azure VisionAzure Vision Endpoint и Azure Vision API KeyПолезно, если вы уже используете облачные сервисы Microsoft.
Google VisionGoogle Vision API Key. JSON сервисной учетной записи используется только для запроса квоты.Полезно, если вы используете сервисы Google Cloud.

Сохраните настройки после заполнения учетных данных.

Для первичного тестирования можно настроить только один сервис. Настраивать все три не нужно.

Настройка Google Vision

Настройка Google состоит из двух частей:

ЦельТребование
Использовать OCRВключить Cloud Vision API, затем создать API Key.
Запрашивать использованиеСоздать сервисную учетную запись, выдать Monitoring Viewer, затем скачать JSON сервисной учетной записи.

Ключ API и сервисная учетная запись Google

Использование Google для OCR

  1. Откройте Google Cloud Console.
  2. Перейдите в APIs & Services.
  3. Откройте Library, найдите Cloud Vision API и включите его.
  4. Вернитесь в Credentials.
  5. Создайте API Key.
  6. Откройте API Key и скопируйте его.
  7. Вставьте его в Google Vision API Key в ImgHost.
  8. Сохраните.

После этого в диалоге OCR можно выбрать Google Vision.

Запрос использования Google

Запрос квоты не требуется для распознавания.

Он только приблизительно показывает, сколько вызовов Google Vision было использовано за последние 30 дней.

  1. В Google Cloud Console откройте IAM & Admin.
  2. Откройте Service Accounts.
  3. Создайте сервисную учетную запись, например vision-monitor.
  4. Назначьте ей роль Monitoring Viewer.
  5. Откройте сведения о сервисной учетной записи и создайте ключ.
  6. Выберите JSON.
  7. Скачайте созданный JSON-файл.
  8. Вернитесь в ImgHost и импортируйте его в JSON сервисной учетной записи (необязательно).
  9. После успешного импорта нажмите запрос квоты.

После импорта ImgHost показывает имя проекта, которому принадлежит сервисная учетная запись. При запросе использования ImgHost считывает данные мониторинга Google и показывает количество вызовов за этот месяц.

Кратко:

ЭлементНазначение
Google Vision API KeyВыполняет OCR-распознавание.
JSON сервисной учетной записиЗапрашивает, сколько вызовов Google Vision было использовано.
Роль Monitoring ViewerПозволяет сервисной учетной записи читать данные об использовании.

Получение токена Baidu PaddleOCR

Baidu PaddleOCR требует токен доступа.

Получение токена PaddleOCR

Откройте окно вызова API на странице Baidu PaddleOCR, нажмите получение токена и скопируйте его.

Вернитесь в ImgHost, вставьте его в PaddleOCR Token и сохраните.

Запуск распознавания

В управлении файлами выберите изображение или снимок экрана документа и нажмите OCR.

OCR-распознавание

В диалоге выберите сервис и модель распознавания.

Распространенные варианты моделей PaddleOCR:

МодельЛучше всего подходит для
PP-StructureV3Рекомендуется по умолчанию. Хорошо подходит для документов, таблиц, формул, печатей и смешанных макетов.
PP-OCRv5Простые изображения, обычный текст и легкое распознавание.
PaddleOCR-VLМногоязычные и сложные изображения, а также содержимое, похожее на диаграммы.
PaddleOCR-VL-1.5Более сложные страницы документов и восстановление макета.

Если не уверены, начните с PP-StructureV3.

Расширенные параметры

ПараметрОписание
Коррекция ориентацииИспользуйте, когда изображение повернуто или перекошено.
Выравнивание документаИспользуйте для сфотографированных документов с изгибом или наклоном.
Определение макетаИспользуйте, когда нужно сохранить структуру заголовков, абзацев, таблиц и изображений.
Распознавание диаграммИспользуйте, когда изображение содержит диаграммы или сложные структуры.
Улучшение MarkdownДелает экспортированный Markdown более удобным для чтения.

Для обычных снимков экрана оставляйте минимум параметров. Для сканов документов включайте больше параметров, связанных с документами.

Просмотр результатов

После завершения распознавания диалог показывает результат.

Его можно скопировать напрямую или выбрать форматы экспорта.

Распознавание PDF

Для страниц документов экспортированный PDF может сохранять внешний вид страницы и оставлять текст доступным для поиска. Это полезно для архивирования сканов и последующего поиска содержимого.

Выбор формата экспорта

ФорматЛучше всего подходит для
Markdown (.md)Заметки, системы документации и последующее редактирование.
PDF (.pdf)Сохранение внешнего вида страницы и результатов сканирования документов.
Word (.docx)Дальнейшее редактирование макета, изменение текста и передача другим людям.
Экспортировать всеСохраняет несколько форматов и исходное изображение, подходит для важных архивов.

Если нужен только текст, экспортируйте Markdown.

Если нужно сохранить внешний вид страницы, используйте PDF или Word.

Результат Word

Экспортированные документы Word можно открывать и редактировать в офисных приложениях.

Результат Word

В результат Word для некоторых документов попадают распознанные изображения, заголовки и абзацы.

Качество распознавания зависит от четкости исходного изображения, выбора модели и сложности документа.

Лучшие типы файлов для OCR

Тип файлаРекомендация
Четкие снимки экранаРаспознавайте напрямую.
СканыПредпочитайте PP-StructureV3.
Сфотографированные документыВключите коррекцию ориентации и выравнивание документа.
Таблицы, формулы, печатиПредпочитайте структурированные модели.
Простые изображения с коротким текстомPP-OCRv5 обычно достаточно.

Более четкие изображения с более ровным текстом обычно дают лучшие результаты.

Распространенные случаи

СлучайЗначение
Распознавание не удалосьПроверьте, сохранен ли токен или ключ сервиса.
Распознавание идет медленноСложные документы и большие изображения требуют больше времени.
Таблица неполнаяПопробуйте структурированную модель.
В тексте есть ошибкиРазмытие, блики и перекос увеличивают ошибки распознавания. Попробуйте более четкое изображение.
Результат Word содержит много изображенийСтруктурированные модели могут сохранять часть распознанных изображений. Это нормально.

Сбой запроса квоты Google

Проверьте:

  1. JSON сервисной учетной записи импортирован.
  2. У сервисной учетной записи есть роль Monitoring Viewer.
  3. Cloud Vision API включен для проекта.

Если вам нужен только OCR, а не запрос использования, можно не использовать JSON сервисной учетной записи и заполнить только Google Vision API Key.

Краткий порядок действий

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.