Skip to content

OCR

OCR витягує текст із зображень, сканів і знімків екрана документів.

Після розпізнавання можна скопіювати результат, експортувати його як Markdown, PDF або Word, або запакувати кілька форматів разом для завантаження.

Що може OCR

МожливістьОпис
Розпізнавання тексту на зображенняхВитягує текст із зображень, знімків екрана та сканів.
Розпізнавання макета документаКраще підходить для таблиць, формул, печаток і змішаних макетів із текстом та зображеннями.
Кілька сервісівПідтримує Baidu PaddleOCR, Microsoft Azure Vision і Google Vision.
Копіювання результатівКопіює розпізнаний текст після обробки.
Експорт файлівЕкспортує Markdown, PDF і Word.
ПакетуванняПісля розпізнавання кількох файлів дає змогу завантажити результати пакетом.

Спочатку налаштуйте сервіси OCR

Відкрийте:

text
System Settings -> Other Settings -> OCR

IP-геолокація та OCR

Заповніть облікові дані для сервісів, які хочете використовувати:

СервісЩо ввестиНайкраще підходить для
Baidu PaddleOCRPaddleOCR TokenРекомендований перший вибір. Добре підходить для документів, зображень, таблиць і змішаних макетів.
Microsoft Azure VisionAzure Vision Endpoint і Azure Vision API KeyКорисно, якщо ви вже використовуєте хмарні сервіси Microsoft.
Google VisionGoogle Vision API Key. Сервісний обліковий запис JSON використовується лише для запиту квоти.Корисно, якщо ви використовуєте сервіси Google Cloud.

Збережіть після заповнення облікових даних.

Для початкового тестування можна налаштувати лише один сервіс. Усі три не потрібні.

Налаштування Google Vision

Налаштування Google має дві частини:

МетаВимога
Використовувати OCRУвімкнути Cloud Vision API, а потім створити API Key.
Перевіряти використанняСтворити сервісний обліковий запис, надати Monitoring Viewer, а потім завантажити JSON сервісного облікового запису.

Ключ API та сервісний обліковий запис Google

Використання Google для OCR

  1. Відкрийте Google Cloud Console.
  2. Перейдіть до APIs & Services.
  3. Відкрийте Library, знайдіть Cloud Vision API і ввімкніть його.
  4. Поверніться до Credentials.
  5. Створіть API Key.
  6. Відкрийте API Key і скопіюйте його.
  7. Вставте його в Google Vision API Key в ImgHost.
  8. Збережіть.

Після цього можна вибрати Google Vision у діалозі OCR.

Запит використання Google

Запит квоти не потрібен для розпізнавання.

Він лише приблизно показує, скільки викликів Google Vision було використано за останні 30 днів.

  1. У Google Cloud Console відкрийте IAM & Admin.
  2. Відкрийте Service Accounts.
  3. Створіть сервісний обліковий запис, наприклад vision-monitor.
  4. Надайте йому роль Monitoring Viewer.
  5. Відкрийте деталі сервісного облікового запису та створіть ключ.
  6. Виберіть JSON.
  7. Завантажте створений JSON-файл.
  8. Поверніться до ImgHost і імпортуйте його в поле сервісного облікового запису JSON (необов'язково).
  9. Після успішного імпорту натисніть запит квоти.

Після імпорту ImgHost показує назву проєкту, якому належить сервісний обліковий запис. Під час запиту використання ImgHost читає дані моніторингу Google і показує кількість викликів за цей місяць.

Коротко:

ЕлементПризначення
Google Vision API KeyВиконує OCR-розпізнавання.
Сервісний обліковий запис JSONЗапитує, скільки викликів Google Vision було використано.
Роль Monitoring ViewerДозволяє сервісному обліковому запису читати дані використання.

Отримання Baidu PaddleOCR Token

Baidu PaddleOCR потребує токена доступу.

Отримання токена PaddleOCR

Відкрийте вікно виклику API на сторінці Baidu PaddleOCR, натисніть отримання токена та скопіюйте його.

Поверніться до ImgHost, вставте його в PaddleOCR Token і збережіть.

Початок розпізнавання

У керуванні файлами виберіть зображення або знімок екрана документа та натисніть OCR.

OCR-розпізнавання

У діалозі виберіть сервіс і модель розпізнавання.

Поширені варіанти моделей PaddleOCR:

МодельНайкраще підходить для
PP-StructureV3Рекомендований стандартний варіант. Добре підходить для документів, таблиць, формул, печаток і змішаних макетів.
PP-OCRv5Прості зображення, звичайний текст і легке розпізнавання.
PaddleOCR-VLБагатомовні, складні зображення та вміст, схожий на діаграми.
PaddleOCR-VL-1.5Складніші сторінки документів і відновлення макета.

Якщо не впевнені, почніть із PP-StructureV3.

Розширені параметри

ПараметрОпис
Корекція орієнтаціїВикористовуйте, коли зображення повернуте або перекошене.
Вирівнювання документаВикористовуйте для сфотографованих документів із викривленням або нахилом.
Виявлення макетаВикористовуйте, коли потрібно зберегти структуру заголовків, абзаців, таблиць і зображень.
Розпізнавання діаграмВикористовуйте, коли зображення містить діаграми або складні структури.
Покращення MarkdownРобить експортований Markdown зручнішим для читання.

Для звичайних знімків екрана залишайте мінімум параметрів. Для сканів документів увімкніть більше параметрів, пов'язаних із документами.

Перегляд результатів

Після завершення розпізнавання діалог показує результат.

Його можна скопіювати напряму або вибрати формати експорту.

Розпізнавання PDF

Для сторінок документів експортований PDF може зберігати вигляд сторінки й залишати текст доступним для пошуку. Це корисно для архівування сканів і подальшого пошуку вмісту.

Вибір формату експорту

ФорматНайкраще підходить для
Markdown (.md)Нотатки, системи документації та подальше редагування.
PDF (.pdf)Збереження вигляду сторінки та результатів сканованих документів.
Word (.docx)Подальше редагування макета, зміна тексту та передавання іншим людям.
Експортувати всеЗберігає кілька форматів і вихідне зображення, підходить для важливих архівів.

Якщо потрібен лише текст, експортуйте Markdown.

Якщо потрібно зберегти вигляд сторінки, використовуйте PDF або Word.

Вивід Word

Експортовані документи Word можна відкривати й редагувати в офісних програмах.

Результат Word

Деякі документи містять розпізнані зображення, заголовки та абзаци у виводі Word.

Якість розпізнавання залежить від чіткості вихідного зображення, вибору моделі та складності документа.

Найкращі типи файлів для OCR

Тип файлуРекомендація
Чіткі знімки екранаРозпізнавайте напряму.
СканиНадавайте перевагу PP-StructureV3.
Сфотографовані документиУвімкніть корекцію орієнтації та вирівнювання документа.
Таблиці, формули, печаткиНадавайте перевагу структурованим моделям.
Прості зображення з коротким текстомPP-OCRv5 зазвичай достатньо.

Чіткіші зображення з рівнішим текстом зазвичай дають кращі результати.

Поширені випадки

ВипадокЗначення
Розпізнавання не вдаєтьсяПеревірте, чи збережено токен або ключ сервісу.
Розпізнавання повільнеСкладні документи та великі зображення потребують більше часу.
Таблиця неповнаСпробуйте структуровану модель.
У тексті є помилкиРозмиття, відблиски та перекіс збільшують помилки розпізнавання. Спробуйте чіткіше зображення.
Вивід Word містить багато зображеньСтруктуровані моделі можуть зберігати частину розпізнаних зображень. Це нормально.

Не вдається запитати квоту Google

Перевірте:

  1. Сервісний обліковий запис JSON імпортовано.
  2. Сервісний обліковий запис має роль Monitoring Viewer.
  3. Cloud Vision API увімкнено для проєкту.

Якщо вам потрібен лише OCR, а не запит використання, можна не використовувати JSON сервісного облікового запису та заповнити лише Google Vision API Key.

Швидкий порядок дій

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.