OCR
OCR извлекает текст из изображений, сканов и снимков экранов документов.
После распознавания можно скопировать результат, экспортировать его как Markdown, PDF или Word, либо упаковать несколько форматов вместе для скачивания.
Что может OCR
| Возможность | Описание |
|---|---|
| Распознавание текста на изображениях | Извлекает текст из изображений, снимков экрана и сканов. |
| Распознавание макета документа | Лучше подходит для таблиц, формул, печатей и смешанных макетов с текстом и изображениями. |
| Несколько сервисов | Поддерживает Baidu PaddleOCR, Microsoft Azure Vision и Google Vision. |
| Копирование результатов | Копирует распознанный текст после обработки. |
| Экспорт файлов | Экспортирует Markdown, PDF и Word. |
| Пакетная упаковка | После распознавания нескольких файлов позволяет скачать результаты одним пакетом. |
Сначала настройте сервисы OCR
Откройте:
text
System Settings -> Other Settings -> OCR
Заполните учетные данные для сервисов, которые хотите использовать:
| Сервис | Что указать | Лучше всего подходит для |
|---|---|---|
| Baidu PaddleOCR | PaddleOCR Token | Рекомендуемый первый вариант. Хорошо подходит для документов, изображений, таблиц и смешанных макетов. |
| Microsoft Azure Vision | Azure Vision Endpoint и Azure Vision API Key | Полезно, если вы уже используете облачные сервисы Microsoft. |
| Google Vision | Google Vision API Key. JSON сервисной учетной записи используется только для запроса квоты. | Полезно, если вы используете сервисы Google Cloud. |
Сохраните настройки после заполнения учетных данных.
Для первичного тестирования можно настроить только один сервис. Настраивать все три не нужно.
Настройка Google Vision
Настройка Google состоит из двух частей:
| Цель | Требование |
|---|---|
| Использовать OCR | Включить Cloud Vision API, затем создать API Key. |
| Запрашивать использование | Создать сервисную учетную запись, выдать Monitoring Viewer, затем скачать JSON сервисной учетной записи. |

Использование Google для OCR
- Откройте Google Cloud Console.
- Перейдите в
APIs & Services. - Откройте
Library, найдитеCloud Vision APIи включите его. - Вернитесь в
Credentials. - Создайте
API Key. - Откройте API Key и скопируйте его.
- Вставьте его в
Google Vision API Keyв ImgHost. - Сохраните.
После этого в диалоге OCR можно выбрать Google Vision.
Запрос использования Google
Запрос квоты не требуется для распознавания.
Он только приблизительно показывает, сколько вызовов Google Vision было использовано за последние 30 дней.
- В Google Cloud Console откройте
IAM & Admin. - Откройте
Service Accounts. - Создайте сервисную учетную запись, например
vision-monitor. - Назначьте ей роль
Monitoring Viewer. - Откройте сведения о сервисной учетной записи и создайте ключ.
- Выберите
JSON. - Скачайте созданный JSON-файл.
- Вернитесь в ImgHost и импортируйте его в
JSONсервисной учетной записи (необязательно). - После успешного импорта нажмите запрос квоты.
После импорта ImgHost показывает имя проекта, которому принадлежит сервисная учетная запись. При запросе использования ImgHost считывает данные мониторинга Google и показывает количество вызовов за этот месяц.
Кратко:
| Элемент | Назначение |
|---|---|
Google Vision API Key | Выполняет OCR-распознавание. |
JSON сервисной учетной записи | Запрашивает, сколько вызовов Google Vision было использовано. |
Роль Monitoring Viewer | Позволяет сервисной учетной записи читать данные об использовании. |
Получение токена Baidu PaddleOCR
Baidu PaddleOCR требует токен доступа.

Откройте окно вызова API на странице Baidu PaddleOCR, нажмите получение токена и скопируйте его.
Вернитесь в ImgHost, вставьте его в PaddleOCR Token и сохраните.
Запуск распознавания
В управлении файлами выберите изображение или снимок экрана документа и нажмите OCR.

В диалоге выберите сервис и модель распознавания.
Распространенные варианты моделей PaddleOCR:
| Модель | Лучше всего подходит для |
|---|---|
PP-StructureV3 | Рекомендуется по умолчанию. Хорошо подходит для документов, таблиц, формул, печатей и смешанных макетов. |
PP-OCRv5 | Простые изображения, обычный текст и легкое распознавание. |
PaddleOCR-VL | Многоязычные и сложные изображения, а также содержимое, похожее на диаграммы. |
PaddleOCR-VL-1.5 | Более сложные страницы документов и восстановление макета. |
Если не уверены, начните с PP-StructureV3.
Расширенные параметры
| Параметр | Описание |
|---|---|
| Коррекция ориентации | Используйте, когда изображение повернуто или перекошено. |
| Выравнивание документа | Используйте для сфотографированных документов с изгибом или наклоном. |
| Определение макета | Используйте, когда нужно сохранить структуру заголовков, абзацев, таблиц и изображений. |
| Распознавание диаграмм | Используйте, когда изображение содержит диаграммы или сложные структуры. |
Улучшение Markdown | Делает экспортированный Markdown более удобным для чтения. |
Для обычных снимков экрана оставляйте минимум параметров. Для сканов документов включайте больше параметров, связанных с документами.
Просмотр результатов
После завершения распознавания диалог показывает результат.
Его можно скопировать напрямую или выбрать форматы экспорта.

Для страниц документов экспортированный PDF может сохранять внешний вид страницы и оставлять текст доступным для поиска. Это полезно для архивирования сканов и последующего поиска содержимого.
Выбор формата экспорта
| Формат | Лучше всего подходит для |
|---|---|
Markdown (.md) | Заметки, системы документации и последующее редактирование. |
PDF (.pdf) | Сохранение внешнего вида страницы и результатов сканирования документов. |
Word (.docx) | Дальнейшее редактирование макета, изменение текста и передача другим людям. |
| Экспортировать все | Сохраняет несколько форматов и исходное изображение, подходит для важных архивов. |
Если нужен только текст, экспортируйте Markdown.
Если нужно сохранить внешний вид страницы, используйте PDF или Word.
Результат Word
Экспортированные документы Word можно открывать и редактировать в офисных приложениях.

В результат Word для некоторых документов попадают распознанные изображения, заголовки и абзацы.
Качество распознавания зависит от четкости исходного изображения, выбора модели и сложности документа.
Лучшие типы файлов для OCR
| Тип файла | Рекомендация |
|---|---|
| Четкие снимки экрана | Распознавайте напрямую. |
| Сканы | Предпочитайте PP-StructureV3. |
| Сфотографированные документы | Включите коррекцию ориентации и выравнивание документа. |
| Таблицы, формулы, печати | Предпочитайте структурированные модели. |
| Простые изображения с коротким текстом | PP-OCRv5 обычно достаточно. |
Более четкие изображения с более ровным текстом обычно дают лучшие результаты.
Распространенные случаи
| Случай | Значение |
|---|---|
| Распознавание не удалось | Проверьте, сохранен ли токен или ключ сервиса. |
| Распознавание идет медленно | Сложные документы и большие изображения требуют больше времени. |
| Таблица неполная | Попробуйте структурированную модель. |
| В тексте есть ошибки | Размытие, блики и перекос увеличивают ошибки распознавания. Попробуйте более четкое изображение. |
| Результат Word содержит много изображений | Структурированные модели могут сохранять часть распознанных изображений. Это нормально. |
Сбой запроса квоты Google
Проверьте:
JSONсервисной учетной записи импортирован.- У сервисной учетной записи есть роль
Monitoring Viewer. Cloud Vision APIвключен для проекта.
Если вам нужен только OCR, а не запрос использования, можно не использовать JSON сервисной учетной записи и заполнить только Google Vision API Key.
Краткий порядок действий
text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word