Skip to content

OCR

OCR extrahiert Text aus Bildern, Scans und Screenshots von Dokumenten.

Nach der Erkennung können Sie das Ergebnis kopieren, als Markdown, PDF oder Word exportieren oder mehrere Formate zusammen als Paket herunterladen.

Was OCR leisten kann

FunktionBeschreibung
BildtexterkennungExtrahiert Text aus Bildern, Screenshots und Scans.
Erkennung von DokumentlayoutBesser geeignet für Tabellen, Formeln, Stempel und gemischte Text-Bild-Layouts.
Mehrere DiensteUnterstützt Baidu PaddleOCR, Microsoft Azure Vision und Google Vision.
Ergebnisse kopierenKopiert den erkannten Text nach der Verarbeitung.
Dateien exportierenExportiert Markdown, PDF und Word.
StapelpaketNach der Erkennung mehrerer Dateien können Ergebnisse als Paket heruntergeladen werden.

OCR-Dienste zuerst konfigurieren

Öffnen Sie:

text
System Settings -> Other Settings -> OCR

IP-Geolokalisierung und OCR

Füllen Sie die Zugangsdaten für die Dienste aus, die Sie verwenden möchten:

DienstWas einzutragen istAm besten geeignet für
Baidu PaddleOCRPaddleOCR TokenEmpfohlene erste Wahl. Gut für Dokumente, Bilder, Tabellen und gemischte Layouts.
Microsoft Azure VisionAzure Vision Endpoint und Azure Vision API KeyNützlich, wenn Sie bereits Microsoft-Clouddienste verwenden.
Google VisionGoogle Vision API Key. Dienstkonto-JSON wird nur für die Kontingentabfrage verwendet.Nützlich, wenn Sie Google Cloud-Dienste verwenden.

Speichern Sie nach dem Eintragen der Zugangsdaten.

Für erste Tests reicht es, nur einen Dienst zu konfigurieren. Sie benötigen nicht alle drei.

Google Vision einrichten

Die Google-Einrichtung besteht aus zwei Teilen:

ZielAnforderung
OCR verwendenCloud Vision API aktivieren und anschließend einen API Key erstellen.
Nutzung abfragenDienstkonto erstellen, Monitoring Viewer zuweisen und anschließend das Dienstkonto-JSON herunterladen.

Google API Key und Dienstkonto

Google für OCR verwenden

  1. Öffnen Sie Google Cloud Console.
  2. Wechseln Sie zu APIs & Services.
  3. Öffnen Sie Library, suchen Sie nach Cloud Vision API und aktivieren Sie sie.
  4. Kehren Sie zu Credentials zurück.
  5. Erstellen Sie einen API Key.
  6. Öffnen Sie den API Key und kopieren Sie ihn.
  7. Fügen Sie ihn in ImgHost unter Google Vision API Key ein.
  8. Speichern Sie.

Danach können Sie Google Vision im OCR-Dialog auswählen.

Google-Nutzung abfragen

Die Kontingentabfrage ist für die Erkennung nicht erforderlich.

Sie zeigt nur grob an, wie viele Google Vision-Aufrufe in den letzten 30 Tagen verwendet wurden.

  1. Öffnen Sie in Google Cloud Console IAM & Admin.
  2. Öffnen Sie Service Accounts.
  3. Erstellen Sie ein Dienstkonto, zum Beispiel vision-monitor.
  4. Weisen Sie ihm die Rolle Monitoring Viewer zu.
  5. Öffnen Sie die Details des Dienstkontos und erstellen Sie einen Schlüssel.
  6. Wählen Sie JSON.
  7. Laden Sie die erzeugte JSON-Datei herunter.
  8. Kehren Sie zu ImgHost zurück und importieren Sie sie unter Dienstkonto-JSON (optional).
  9. Klicken Sie nach erfolgreichem Import auf Kontingentabfrage.

Nach dem Import zeigt ImgHost den Projektnamen an, zu dem das Dienstkonto gehört. Bei der Nutzungsabfrage liest ImgHost Google-Monitoring-Daten und zeigt die Aufrufzahl dieses Monats an.

Kurz gesagt:

ElementZweck
Google Vision API KeyFührt OCR-Erkennung aus.
Dienstkonto-JSONFragt ab, wie viele Google Vision-Aufrufe verwendet wurden.
Rolle Monitoring ViewerErlaubt dem Dienstkonto, Nutzungsdaten zu lesen.

Baidu PaddleOCR Token abrufen

Baidu PaddleOCR benötigt ein Zugriffstoken.

PaddleOCR-Token abrufen

Öffnen Sie auf der Baidu PaddleOCR-Seite das API-Aufruffenster, klicken Sie zum Abrufen eines Tokens und kopieren Sie es.

Kehren Sie zu ImgHost zurück, fügen Sie es in PaddleOCR Token ein und speichern Sie.

Erkennung starten

Wählen Sie in der Dateiverwaltung ein Bild oder einen Dokument-Screenshot aus und klicken Sie auf OCR.

OCR-Erkennung

Wählen Sie im Dialog den Erkennungsdienst und das Modell aus.

Häufige PaddleOCR-Modellauswahlen:

ModellAm besten geeignet für
PP-StructureV3Empfohlener Standard. Gut für Dokumente, Tabellen, Formeln, Stempel und gemischte Layouts.
PP-OCRv5Einfache Bilder, normaler Text und leichte Erkennung.
PaddleOCR-VLMehrsprachige, komplexe Bilder und diagrammartige Inhalte.
PaddleOCR-VL-1.5Komplexere Dokumentseiten und Layout-Wiederherstellung.

Wenn Sie unsicher sind, beginnen Sie mit PP-StructureV3.

Erweiterte Optionen

OptionBeschreibung
AusrichtungskorrekturVerwenden, wenn das Bild gedreht oder schief ist.
DokumentglättungFür fotografierte Dokumente mit Wölbung oder Neigung verwenden.
LayouterkennungVerwenden, wenn Überschriften, Absätze, Tabellen und Bildstruktur erhalten bleiben sollen.
DiagrammerkennungVerwenden, wenn das Bild Diagramme oder komplexe Strukturen enthält.
Markdown verschönernMacht exportiertes Markdown leichter lesbar.

Für normale Screenshots halten Sie die Optionen minimal. Für Dokumentenscans aktivieren Sie mehr dokumentbezogene Optionen.

Ergebnisse anzeigen

Nach Abschluss der Erkennung zeigt der Dialog das Ergebnis.

Sie können es direkt kopieren oder Exportformate auswählen.

PDF-Erkennung

Bei Dokumentseiten kann das exportierte PDF das Erscheinungsbild der Seite bewahren und den Text zugleich durchsuchbar halten. Das ist nützlich zum Archivieren von Scans und zum späteren Auffinden von Inhalten.

Exportformat auswählen

FormatAm besten geeignet für
Markdown (.md)Notizen, Dokumentationssysteme und spätere Bearbeitung.
PDF (.pdf)Bewahrung des Seitenbilds und von Ergebnissen gescannter Dokumente.
Word (.docx)Weitere Layoutbearbeitung, Textänderungen und Übergabe an andere.
Alles exportierenSpeichert mehrere Formate und das Originalbild, geeignet für wichtige Archive.

Wenn Sie nur Text benötigen, exportieren Sie Markdown.

Wenn Sie das Seitenbild benötigen, verwenden Sie PDF oder Word.

Word-Ausgabe

Exportierte Word-Dokumente können mit Office-Software geöffnet und bearbeitet werden.

Word-Ergebnis

Einige Dokumente enthalten in der Word-Ausgabe erkannte Bilder, Überschriften und Absätze.

Die Erkennungsqualität hängt von der Klarheit des Originalbilds, der Modellwahl und der Komplexität des Dokuments ab.

Beste Dateitypen für OCR

DateitypEmpfehlung
Klare ScreenshotsDirekt erkennen.
ScansPP-StructureV3 bevorzugen.
Fotografierte DokumenteAusrichtungskorrektur und Dokumentglättung aktivieren.
Tabellen, Formeln, StempelStrukturierte Modelle bevorzugen.
Einfache kurze TextbilderPP-OCRv5 reicht normalerweise aus.

Klarere Bilder mit geraderem Text liefern normalerweise bessere Ergebnisse.

Häufige Fälle

FallBedeutung
Erkennung schlägt fehlPrüfen Sie, ob das Diensttoken oder der Schlüssel gespeichert wurde.
Erkennung ist langsamKomplexe Dokumente und große Bilder benötigen mehr Zeit.
Tabelle ist unvollständigVersuchen Sie ein strukturiertes Modell.
Text enthält FehlerUnschärfe, Blendung und Schräglage erhöhen Erkennungsfehler. Versuchen Sie ein klareres Bild.
Word-Ausgabe enthält viele BilderStrukturierte Modelle können einige erkannte Bilder erhalten. Das ist normal.

Google-Kontingentabfrage schlägt fehl

Prüfen Sie:

  1. Dienstkonto-JSON wurde importiert.
  2. Das Dienstkonto hat die Rolle Monitoring Viewer.
  3. Cloud Vision API ist für das Projekt aktiviert.

Wenn Sie nur OCR und keine Nutzungsabfrage benötigen, können Sie das Dienstkonto-JSON ignorieren und nur Google Vision API Key ausfüllen.

Schnellablauf

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.