Skip to content

OCR

OCR získává text z obrázků, skenů a snímků obrazovky dokumentů.

Po rozpoznání můžete výsledek zkopírovat, exportovat jako Markdown, PDF nebo Word, případně více formátů zabalit dohromady ke stažení.

Co OCR umí

FunkcePopis
Rozpoznávání textu v obrázcíchZískává text z obrázků, snímků obrazovky a skenů.
Rozpoznávání rozložení dokumentuVhodnější pro tabulky, vzorce, razítka a smíšená textově-obrazová rozložení.
Více služebPodporuje Baidu PaddleOCR, Microsoft Azure Vision a Google Vision.
Kopírování výsledkůPo zpracování zkopíruje rozpoznaný text.
Export souborůExportuje Markdown, PDF a Word.
Hromadné baleníPo rozpoznání více souborů stáhne výsledky jako balíček.

Nejdřív nastavte služby OCR

Otevřete:

text
System Settings -> Other Settings -> OCR

IP geolokace a OCR

Vyplňte přihlašovací údaje ke službám, které chcete použít:

SlužbaCo zadatNejvhodnější pro
Baidu PaddleOCRPaddleOCR TokenDoporučená první volba. Dobré pro dokumenty, obrázky, tabulky a smíšená rozložení.
Microsoft Azure VisionAzure Vision Endpoint a Azure Vision API KeyUžitečné, pokud už používáte cloudové služby Microsoft.
Google VisionGoogle Vision API Key. Servisní účet JSON slouží pouze k dotazu na kvótu.Užitečné, pokud používáte služby Google Cloud.

Po vyplnění přihlašovacích údajů uložte.

Pro první test stačí nastavit jednu službu. Není nutné mít všechny tři.

Nastavení Google Vision

Nastavení Google má dvě části:

CílPožadavek
Použít OCRZapnout Cloud Vision API, potom vytvořit API Key.
Dotaz na využitíVytvořit servisní účet, udělit roli Monitoring Viewer, potom stáhnout servisní účet JSON.

Google API key a servisní účet

Použití Google pro OCR

  1. Otevřete Google Cloud Console.
  2. Přejděte do APIs & Services.
  3. Otevřete Library, vyhledejte Cloud Vision API a zapněte ji.
  4. Vraťte se do Credentials.
  5. Vytvořte API Key.
  6. Otevřete API Key a zkopírujte ho.
  7. Vložte ho do Google Vision API Key v ImgHost.
  8. Uložte.

Potom můžete v dialogu OCR zvolit Google Vision.

Dotaz na využití Google

Dotaz na kvótu není nutný pro samotné rozpoznávání.

Pouze přibližně ukáže, kolik volání Google Vision bylo použito za posledních 30 dní.

  1. V Google Cloud Console otevřete IAM & Admin.
  2. Otevřete Service Accounts.
  3. Vytvořte servisní účet, například vision-monitor.
  4. Udělte mu roli Monitoring Viewer.
  5. Otevřete detail servisního účtu a vytvořte klíč.
  6. Vyberte JSON.
  7. Stáhněte vygenerovaný soubor JSON.
  8. Vraťte se do ImgHost a importujte ho jako servisní účet JSON (volitelné).
  9. Po úspěšném importu klikněte na dotaz na kvótu.

Po importu ImgHost zobrazí název projektu, ke kterému servisní účet patří. Při dotazu na využití čte ImgHost data sledování Google a zobrazí počet volání za tento měsíc.

Stručně:

PoložkaÚčel
Google Vision API KeyProvádí rozpoznávání OCR.
Servisní účet JSONDotazuje se, kolik volání Google Vision bylo použito.
Role Monitoring ViewerUmožňuje servisnímu účtu číst data o využití.

Získání Baidu PaddleOCR Token

Baidu PaddleOCR vyžaduje přístupový token.

Získání tokenu PaddleOCR

Na stránce Baidu PaddleOCR otevřete okno volání API, klikněte na získání tokenu a zkopírujte ho.

Vraťte se do ImgHost, vložte ho do PaddleOCR Token a uložte.

Spuštění rozpoznávání

Ve správě souborů vyberte obrázek nebo snímek obrazovky dokumentu a klikněte na OCR.

Rozpoznávání OCR

V dialogu vyberte službu rozpoznávání a model.

Běžné volby modelů PaddleOCR:

ModelNejvhodnější pro
PP-StructureV3Doporučený výchozí model. Dobré pro dokumenty, tabulky, vzorce, razítka a smíšená rozložení.
PP-OCRv5Jednoduché obrázky, běžný text a lehké rozpoznávání.
PaddleOCR-VLVícejazyčné, složité obrázky a obsah podobný grafům.
PaddleOCR-VL-1.5Složitější stránky dokumentů a obnovu rozložení.

Pokud si nejste jistí, začněte s PP-StructureV3.

Pokročilé volby

VolbaPopis
Korekce orientacePoužijte, když je obrázek otočený nebo nakloněný.
Narovnání dokumentuPoužijte pro fotografované dokumenty se zakřivením nebo sklonem.
Detekce rozloženíPoužijte, když chcete zachovat nadpisy, odstavce, tabulky a strukturu obrázku.
Rozpoznávání grafůPoužijte, když obrázek obsahuje grafy nebo složité struktury.
Vylepšit MarkdownZpřehlední exportovaný Markdown.

U běžných snímků obrazovky ponechte voleb minimum. U skenů dokumentů zapněte více voleb souvisejících s dokumenty.

Zobrazení výsledků

Po dokončení rozpoznávání dialog zobrazí výsledek.

Můžete ho zkopírovat přímo nebo vybrat exportní formáty.

Rozpoznávání PDF

U stránek dokumentů může exportovaný PDF zachovat vzhled stránky a zároveň udržet text vyhledatelný. To se hodí pro archivaci skenů a pozdější vyhledávání obsahu.

Výběr exportního formátu

FormátNejvhodnější pro
Markdown (.md)Poznámky, dokumentační systémy a pozdější úpravy.
PDF (.pdf)Zachování vzhledu stránky a výsledků skenovaných dokumentů.
Word (.docx)Další úpravy rozložení, úpravy textu a předání ostatním.
Exportovat všeUloží více formátů a původní obrázek; vhodné pro důležité archivy.

Pokud potřebujete jen text, exportujte Markdown.

Pokud potřebujete vzhled stránky, použijte PDF nebo Word.

Výstup Word

Exportované dokumenty Word lze otevřít a upravovat v kancelářském softwaru.

Výsledek Word

Některé dokumenty ve výstupu Word obsahují rozpoznané obrázky, nadpisy a odstavce.

Kvalita rozpoznávání závisí na čitelnosti původního obrázku, volbě modelu a složitosti dokumentu.

Nejlepší typy souborů pro OCR

Typ souboruDoporučení
Čitelné snímky obrazovkyRozpoznávejte přímo.
SkenyPreferujte PP-StructureV3.
Fotografované dokumentyZapněte korekci orientace a narovnání dokumentu.
Tabulky, vzorce, razítkaPreferujte strukturované modely.
Jednoduché obrázky s krátkým textemPP-OCRv5 obvykle stačí.

Čitelnější obrázky s rovnějším textem obvykle dávají lepší výsledky.

Běžné případy

PřípadVýznam
Rozpoznávání selžeZkontrolujte, že je token nebo klíč služby uložený.
Rozpoznávání je pomaléSložité dokumenty a velké obrázky trvají déle.
Tabulka je neúplnáZkuste strukturovaný model.
Text obsahuje chybyRozmazání, odlesky a naklonění zvyšují chybovost rozpoznávání. Zkuste čitelnější obrázek.
Výstup Word obsahuje mnoho obrázkůStrukturované modely mohou zachovat některé rozpoznané obrázky. Je to normální.

Dotaz na kvótu Google selže

Zkontrolujte:

  1. Servisní účet JSON byl importován.
  2. Servisní účet má roli Monitoring Viewer.
  3. Cloud Vision API je v projektu zapnutá.

Pokud potřebujete jen OCR a ne dotaz na využití, můžete JSON servisního účtu ignorovat a vyplnit jen Google Vision API Key.

Rychlý postup

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.