OCR
OCR витягує текст із зображень, сканів і знімків екрана документів.
Після розпізнавання можна скопіювати результат, експортувати його як Markdown, PDF або Word, або запакувати кілька форматів разом для завантаження.
Що може OCR
| Можливість | Опис |
|---|---|
| Розпізнавання тексту на зображеннях | Витягує текст із зображень, знімків екрана та сканів. |
| Розпізнавання макета документа | Краще підходить для таблиць, формул, печаток і змішаних макетів із текстом та зображеннями. |
| Кілька сервісів | Підтримує Baidu PaddleOCR, Microsoft Azure Vision і Google Vision. |
| Копіювання результатів | Копіює розпізнаний текст після обробки. |
| Експорт файлів | Експортує Markdown, PDF і Word. |
| Пакетування | Після розпізнавання кількох файлів дає змогу завантажити результати пакетом. |
Спочатку налаштуйте сервіси OCR
Відкрийте:
text
System Settings -> Other Settings -> OCR
Заповніть облікові дані для сервісів, які хочете використовувати:
| Сервіс | Що ввести | Найкраще підходить для |
|---|---|---|
| Baidu PaddleOCR | PaddleOCR Token | Рекомендований перший вибір. Добре підходить для документів, зображень, таблиць і змішаних макетів. |
| Microsoft Azure Vision | Azure Vision Endpoint і Azure Vision API Key | Корисно, якщо ви вже використовуєте хмарні сервіси Microsoft. |
| Google Vision | Google Vision API Key. Сервісний обліковий запис JSON використовується лише для запиту квоти. | Корисно, якщо ви використовуєте сервіси Google Cloud. |
Збережіть після заповнення облікових даних.
Для початкового тестування можна налаштувати лише один сервіс. Усі три не потрібні.
Налаштування Google Vision
Налаштування Google має дві частини:
| Мета | Вимога |
|---|---|
| Використовувати OCR | Увімкнути Cloud Vision API, а потім створити API Key. |
| Перевіряти використання | Створити сервісний обліковий запис, надати Monitoring Viewer, а потім завантажити JSON сервісного облікового запису. |

Використання Google для OCR
- Відкрийте Google Cloud Console.
- Перейдіть до
APIs & Services. - Відкрийте
Library, знайдітьCloud Vision APIі ввімкніть його. - Поверніться до
Credentials. - Створіть
API Key. - Відкрийте API Key і скопіюйте його.
- Вставте його в
Google Vision API Keyв ImgHost. - Збережіть.
Після цього можна вибрати Google Vision у діалозі OCR.
Запит використання Google
Запит квоти не потрібен для розпізнавання.
Він лише приблизно показує, скільки викликів Google Vision було використано за останні 30 днів.
- У Google Cloud Console відкрийте
IAM & Admin. - Відкрийте
Service Accounts. - Створіть сервісний обліковий запис, наприклад
vision-monitor. - Надайте йому роль
Monitoring Viewer. - Відкрийте деталі сервісного облікового запису та створіть ключ.
- Виберіть
JSON. - Завантажте створений JSON-файл.
- Поверніться до ImgHost і імпортуйте його в поле сервісного облікового запису
JSON(необов'язково). - Після успішного імпорту натисніть запит квоти.
Після імпорту ImgHost показує назву проєкту, якому належить сервісний обліковий запис. Під час запиту використання ImgHost читає дані моніторингу Google і показує кількість викликів за цей місяць.
Коротко:
| Елемент | Призначення |
|---|---|
Google Vision API Key | Виконує OCR-розпізнавання. |
Сервісний обліковий запис JSON | Запитує, скільки викликів Google Vision було використано. |
Роль Monitoring Viewer | Дозволяє сервісному обліковому запису читати дані використання. |
Отримання Baidu PaddleOCR Token
Baidu PaddleOCR потребує токена доступу.

Відкрийте вікно виклику API на сторінці Baidu PaddleOCR, натисніть отримання токена та скопіюйте його.
Поверніться до ImgHost, вставте його в PaddleOCR Token і збережіть.
Початок розпізнавання
У керуванні файлами виберіть зображення або знімок екрана документа та натисніть OCR.

У діалозі виберіть сервіс і модель розпізнавання.
Поширені варіанти моделей PaddleOCR:
| Модель | Найкраще підходить для |
|---|---|
PP-StructureV3 | Рекомендований стандартний варіант. Добре підходить для документів, таблиць, формул, печаток і змішаних макетів. |
PP-OCRv5 | Прості зображення, звичайний текст і легке розпізнавання. |
PaddleOCR-VL | Багатомовні, складні зображення та вміст, схожий на діаграми. |
PaddleOCR-VL-1.5 | Складніші сторінки документів і відновлення макета. |
Якщо не впевнені, почніть із PP-StructureV3.
Розширені параметри
| Параметр | Опис |
|---|---|
| Корекція орієнтації | Використовуйте, коли зображення повернуте або перекошене. |
| Вирівнювання документа | Використовуйте для сфотографованих документів із викривленням або нахилом. |
| Виявлення макета | Використовуйте, коли потрібно зберегти структуру заголовків, абзаців, таблиць і зображень. |
| Розпізнавання діаграм | Використовуйте, коли зображення містить діаграми або складні структури. |
Покращення Markdown | Робить експортований Markdown зручнішим для читання. |
Для звичайних знімків екрана залишайте мінімум параметрів. Для сканів документів увімкніть більше параметрів, пов'язаних із документами.
Перегляд результатів
Після завершення розпізнавання діалог показує результат.
Його можна скопіювати напряму або вибрати формати експорту.

Для сторінок документів експортований PDF може зберігати вигляд сторінки й залишати текст доступним для пошуку. Це корисно для архівування сканів і подальшого пошуку вмісту.
Вибір формату експорту
| Формат | Найкраще підходить для |
|---|---|
Markdown (.md) | Нотатки, системи документації та подальше редагування. |
PDF (.pdf) | Збереження вигляду сторінки та результатів сканованих документів. |
Word (.docx) | Подальше редагування макета, зміна тексту та передавання іншим людям. |
| Експортувати все | Зберігає кілька форматів і вихідне зображення, підходить для важливих архівів. |
Якщо потрібен лише текст, експортуйте Markdown.
Якщо потрібно зберегти вигляд сторінки, використовуйте PDF або Word.
Вивід Word
Експортовані документи Word можна відкривати й редагувати в офісних програмах.

Деякі документи містять розпізнані зображення, заголовки та абзаци у виводі Word.
Якість розпізнавання залежить від чіткості вихідного зображення, вибору моделі та складності документа.
Найкращі типи файлів для OCR
| Тип файлу | Рекомендація |
|---|---|
| Чіткі знімки екрана | Розпізнавайте напряму. |
| Скани | Надавайте перевагу PP-StructureV3. |
| Сфотографовані документи | Увімкніть корекцію орієнтації та вирівнювання документа. |
| Таблиці, формули, печатки | Надавайте перевагу структурованим моделям. |
| Прості зображення з коротким текстом | PP-OCRv5 зазвичай достатньо. |
Чіткіші зображення з рівнішим текстом зазвичай дають кращі результати.
Поширені випадки
| Випадок | Значення |
|---|---|
| Розпізнавання не вдається | Перевірте, чи збережено токен або ключ сервісу. |
| Розпізнавання повільне | Складні документи та великі зображення потребують більше часу. |
| Таблиця неповна | Спробуйте структуровану модель. |
| У тексті є помилки | Розмиття, відблиски та перекіс збільшують помилки розпізнавання. Спробуйте чіткіше зображення. |
| Вивід Word містить багато зображень | Структуровані моделі можуть зберігати частину розпізнаних зображень. Це нормально. |
Не вдається запитати квоту Google
Перевірте:
- Сервісний обліковий запис
JSONімпортовано. - Сервісний обліковий запис має роль
Monitoring Viewer. Cloud Vision APIувімкнено для проєкту.
Якщо вам потрібен лише OCR, а не запит використання, можна не використовувати JSON сервісного облікового запису та заповнити лише Google Vision API Key.
Швидкий порядок дій
text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word