Skip to content

OCR

OCR wyodrębnia tekst z obrazów, skanów i zrzutów ekranu dokumentów.

Po rozpoznaniu możesz skopiować wynik, wyeksportować go jako Markdown, PDF lub Word, albo pobrać kilka formatów razem w pakiecie.

Co potrafi OCR

FunkcjaOpis
Rozpoznawanie tekstu z obrazuWyodrębnia tekst z obrazów, zrzutów ekranu i skanów.
Rozpoznawanie układu dokumentuLepsze dla tabel, formuł, pieczątek i mieszanych układów tekst-obraz.
Wiele usługObsługuje Baidu PaddleOCR, Microsoft Azure Vision i Google Vision.
Kopiowanie wynikówPozwala skopiować rozpoznany tekst po przetworzeniu.
Eksport plikówEksportuje Markdown, PDF i Word.
Pakowanie zbiorczePo rozpoznaniu wielu plików pobiera wyniki jako pakiet.

Najpierw skonfiguruj usługi OCR

Otwórz:

text
System Settings -> Other Settings -> OCR

Geolokalizacja IP i OCR

Wypełnij dane usług, których chcesz użyć:

UsługaCo wpisaćNajlepsze do
Baidu PaddleOCRPaddleOCR TokenZalecany pierwszy wybór. Dobry dla dokumentów, obrazów, tabel i mieszanych układów.
Microsoft Azure VisionAzure Vision Endpoint i Azure Vision API KeyPrzydatne, jeśli używasz już usług chmurowych Microsoft.
Google VisionGoogle Vision API Key. Plik JSON konta usługi służy tylko do zapytania o limit.Przydatne, jeśli używasz Google Cloud.

Po wpisaniu danych zapisz ustawienia.

Do pierwszego testu możesz skonfigurować tylko jedną usługę. Nie potrzebujesz wszystkich trzech.

Konfiguracja Google Vision

Konfiguracja Google ma dwie części:

CelWymaganie
Używanie OCRWłącz Cloud Vision API, potem utwórz API Key.
Zapytanie o użycieUtwórz konto usługi, nadaj rolę Monitoring Viewer, potem pobierz plik JSON konta usługi.

Klucz API Google i konto usługi

Używanie Google do OCR

  1. Otwórz Google Cloud Console.
  2. Przejdź do APIs & Services.
  3. Otwórz Library, wyszukaj Cloud Vision API i włącz.
  4. Wróć do Credentials.
  5. Utwórz API Key.
  6. Otwórz klucz API i skopiuj go.
  7. Wklej do Google Vision API Key w ImgHost.
  8. Zapisz.

Potem możesz wybrać Google Vision w oknie OCR.

Zapytanie o użycie Google

Zapytanie o limit nie jest wymagane do rozpoznawania.

Pokazuje tylko orientacyjnie, ile wywołań Google Vision użyto w ostatnich 30 dniach.

  1. W Google Cloud Console otwórz IAM & Admin.
  2. Otwórz Service Accounts.
  3. Utwórz konto usługi, np. vision-monitor.
  4. Nadaj mu rolę Monitoring Viewer.
  5. Otwórz szczegóły konta usługi i utwórz klucz.
  6. Wybierz JSON.
  7. Pobierz wygenerowany plik JSON.
  8. Wróć do ImgHost i zaimportuj go jako plik JSON konta usługi (opcjonalnie).
  9. Po udanym imporcie kliknij zapytanie o limit.

Po imporcie ImgHost pokazuje nazwę projektu, do którego należy konto usługi. Podczas zapytania odczytuje dane monitorowania Google i pokazuje liczbę wywołań w bieżącym miesiącu.

W skrócie:

ElementCel
Google Vision API KeyWykonuje rozpoznawanie OCR.
Plik JSON konta usługiOdpytuje liczbę użytych wywołań Google Vision.
Rola Monitoring ViewerPozwala kontu usługi czytać dane użycia.

Pobieranie tokenu Baidu PaddleOCR

Baidu PaddleOCR wymaga tokenu dostępu.

Pobieranie tokenu PaddleOCR

Otwórz okno wywołania API na stronie Baidu PaddleOCR, kliknij pobranie tokenu i skopiuj go.

Wróć do ImgHost, wklej do PaddleOCR Token i zapisz.

Rozpoczęcie rozpoznawania

W Zarządzaniu plikami wybierz obraz lub zrzut ekranu dokumentu i kliknij OCR.

Rozpoznawanie OCR

W oknie wybierz usługę rozpoznawania i model.

Popularne modele PaddleOCR:

ModelNajlepsze do
PP-StructureV3Zalecany domyślnie. Dobry dla dokumentów, tabel, formuł, pieczątek i mieszanych układów.
PP-OCRv5Proste obrazy, zwykły tekst i lekkie rozpoznawanie.
PaddleOCR-VLWielojęzyczne, złożone obrazy i treści podobne do wykresów.
PaddleOCR-VL-1.5Bardziej złożone strony dokumentów i odtwarzanie układu.

Jeśli nie masz pewności, zacznij od PP-StructureV3.

Opcje zaawansowane

OpcjaOpis
Korekcja orientacjiUżyj, gdy obraz jest obrócony lub przekrzywiony.
Prostowanie dokumentuUżyj dla fotografowanych dokumentów z krzywizną lub perspektywą.
Wykrywanie układuUżyj, gdy chcesz zachować nagłówki, akapity, tabele i strukturę obrazu.
Rozpoznawanie wykresówUżyj, gdy obraz zawiera wykresy lub złożone struktury.
Ulepsz MarkdownSprawia, że eksportowany Markdown jest czytelniejszy.

Dla zwykłych zrzutów ekranu zostaw minimalne opcje. Dla skanów dokumentów włącz więcej opcji dokumentowych.

Wyniki

Po zakończeniu rozpoznawania okno pokaże wynik.

Możesz go skopiować bezpośrednio albo wybrać format eksportu.

Rozpoznawanie PDF

Dla stron dokumentów eksportowany PDF może zachować wygląd strony i jednocześnie pozwolić na wyszukiwanie tekstu. To przydatne do archiwizacji skanów i późniejszego odnajdywania treści.

Wybór formatu eksportu

FormatNajlepsze do
Markdown (.md)Notatki, systemy dokumentacji i późniejsza edycja.
PDF (.pdf)Zachowanie wyglądu strony i wyników skanowania.
Word (.docx)Dalsza edycja układu, modyfikacja tekstu i przekazanie innym.
Eksport wszystkiegoZapisuje wiele formatów i oryginalny obraz, odpowiednie dla ważnych archiwów.

Jeśli potrzebujesz tylko tekstu, eksportuj Markdown.

Jeśli potrzebujesz wyglądu strony, użyj PDF lub Word.

Wynik Word

Wyeksportowane dokumenty Word można otwierać i edytować w pakietach biurowych.

Wynik Word

Niektóre dokumenty zawierają w wyniku Word rozpoznane obrazy, nagłówki i akapity.

Jakość rozpoznania zależy od ostrości oryginału, wyboru modelu i złożoności dokumentu.

Najlepsze typy plików do OCR

Typ plikuRekomendacja
Wyraźne zrzuty ekranuRozpoznawaj bezpośrednio.
SkanyPreferuj PP-StructureV3.
Fotografowane dokumentyWłącz korekcję orientacji i prostowanie dokumentu.
Tabele, formuły, pieczątkiPreferuj modele strukturalne.
Proste obrazy z krótkim tekstemPP-OCRv5 zwykle wystarczy.

Wyraźniejsze obrazy z tekstem ustawionym bardziej prosto zwykle dają lepsze wyniki.

Typowe przypadki

PrzypadekZnaczenie
Rozpoznawanie się nie udajeSprawdź, czy token lub klucz usługi został zapisany.
Rozpoznawanie jest wolneZłożone dokumenty i duże obrazy wymagają więcej czasu.
Tabela jest niepełnaSpróbuj modelu strukturalnego.
Tekst ma błędyRozmycie, odblaski i przekrzywienie zwiększają liczbę błędów. Spróbuj wyraźniejszego obrazu.
Wynik Word zawiera wiele obrazówModele strukturalne mogą zachować część rozpoznanych obrazów. To normalne.

Zapytanie o limit Google nie działa

Sprawdź:

  1. Zaimportowano plik JSON konta usługi.
  2. Konto usługi ma rolę Monitoring Viewer.
  3. Cloud Vision API jest włączone dla projektu.

Jeśli potrzebujesz tylko OCR, a nie zapytania o użycie, możesz pominąć plik JSON konta usługi i wypełnić tylko Google Vision API Key.

Szybki schemat

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.