Skip to content

OCR

OCR mengekstrak teks dari gambar, pindaian, dan tangkapan layar dokumen.

Setelah pengenalan selesai, Anda dapat menyalin hasilnya, mengekspornya sebagai Markdown, PDF, atau Word, atau mengemas beberapa format sekaligus untuk diunduh.

Yang Dapat Dilakukan OCR

FiturDeskripsi
Pengenalan teks gambarMengekstrak teks dari gambar, tangkapan layar, dan pindaian.
Pengenalan tata letak dokumenLebih cocok untuk tabel, rumus, cap, dan tata letak campuran teks-gambar.
Beberapa layananMendukung Baidu PaddleOCR, Microsoft Azure Vision, dan Google Vision.
Menyalin hasilMenyalin teks yang dikenali setelah pemrosesan.
Ekspor fileMengekspor Markdown, PDF, dan Word.
Pengemasan batchSetelah mengenali beberapa file, hasil dapat diunduh sebagai satu paket.

Konfigurasikan Layanan OCR Terlebih Dahulu

Buka:

text
System Settings -> Other Settings -> OCR

Geolokasi IP dan OCR

Isi kredensial untuk layanan yang ingin Anda gunakan:

LayananYang Perlu DiisiCocok Untuk
Baidu PaddleOCRPaddleOCR TokenPilihan pertama yang disarankan. Baik untuk dokumen, gambar, tabel, dan tata letak campuran.
Microsoft Azure VisionAzure Vision Endpoint dan Azure Vision API KeyBerguna jika Anda sudah menggunakan layanan cloud Microsoft.
Google VisionGoogle Vision API Key. Akun layanan JSON hanya digunakan untuk kueri kuota.Berguna jika Anda menggunakan layanan Google Cloud.

Simpan setelah kredensial diisi.

Untuk pengujian awal, Anda dapat mengonfigurasi satu layanan saja. Anda tidak perlu mengonfigurasi ketiganya.

Penyiapan Google Vision

Penyiapan Google terdiri dari dua bagian:

TujuanPersyaratan
Menggunakan OCRAktifkan Cloud Vision API, lalu buat API Key.
Mengkueri penggunaanBuat akun layanan, beri peran Monitoring Viewer, lalu unduh JSON akun layanan.

Kunci API Google dan akun layanan

Menggunakan Google untuk OCR

  1. Buka Google Cloud Console.
  2. Masuk ke APIs & Services.
  3. Buka Library, cari Cloud Vision API, lalu aktifkan.
  4. Kembali ke Credentials.
  5. Buat API Key.
  6. Buka API Key tersebut dan salin nilainya.
  7. Tempelkan ke Google Vision API Key di ImgHost.
  8. Simpan.

Setelah itu, Anda dapat memilih Google Vision di dialog OCR.

Mengkueri Penggunaan Google

Kueri kuota tidak wajib untuk pengenalan.

Fitur ini hanya menampilkan perkiraan jumlah panggilan Google Vision yang digunakan dalam 30 hari terakhir.

  1. Di Google Cloud Console, buka IAM & Admin.
  2. Buka Service Accounts.
  3. Buat akun layanan, misalnya vision-monitor.
  4. Berikan peran Monitoring Viewer.
  5. Buka detail akun layanan dan buat kunci.
  6. Pilih JSON.
  7. Unduh file JSON yang dibuat.
  8. Kembali ke ImgHost dan impor di bagian JSON akun layanan (opsional).
  9. Setelah impor berhasil, klik kueri kuota.

Setelah impor, ImgHost menampilkan nama project pemilik akun layanan tersebut. Saat mengkueri penggunaan, ImgHost membaca data monitoring Google dan menampilkan jumlah panggilan bulan ini.

Ringkasnya:

ItemTujuan
Google Vision API KeyMenjalankan pengenalan OCR.
File JSON akun layananMengkueri berapa banyak panggilan Google Vision yang sudah digunakan.
Peran Monitoring ViewerMengizinkan akun layanan membaca data penggunaan.

Mendapatkan Baidu PaddleOCR Token

Baidu PaddleOCR membutuhkan token akses.

Mendapatkan token PaddleOCR

Buka jendela pemanggilan API di halaman Baidu PaddleOCR, klik untuk mendapatkan token, lalu salin token tersebut.

Kembali ke ImgHost, tempelkan ke PaddleOCR Token, lalu simpan.

Memulai Pengenalan

Di Manajemen File, pilih gambar atau tangkapan layar dokumen, lalu klik OCR.

Pengenalan OCR

Di dialog, pilih layanan dan model pengenalan.

Pilihan model PaddleOCR yang umum:

ModelCocok Untuk
PP-StructureV3Default yang disarankan. Baik untuk dokumen, tabel, rumus, cap, dan tata letak campuran.
PP-OCRv5Gambar sederhana, teks biasa, dan pengenalan ringan.
PaddleOCR-VLKonten multibahasa, gambar kompleks, dan konten mirip bagan.
PaddleOCR-VL-1.5Halaman dokumen yang lebih kompleks dan pemulihan tata letak.

Jika ragu, mulai dengan PP-StructureV3.

Opsi Lanjutan

OpsiDeskripsi
Koreksi orientasiGunakan saat gambar terputar atau miring.
Perataan dokumenGunakan untuk dokumen yang difoto dengan lengkungan atau kemiringan.
Deteksi tata letakGunakan saat Anda ingin mempertahankan struktur judul, paragraf, tabel, dan gambar.
Pengenalan baganGunakan saat gambar berisi bagan atau struktur kompleks.
Rapikan MarkdownMembuat Markdown hasil ekspor lebih mudah dibaca.

Untuk tangkapan layar biasa, gunakan opsi seminimal mungkin. Untuk pindaian dokumen, aktifkan lebih banyak opsi terkait dokumen.

Melihat Hasil

Setelah pengenalan selesai, dialog menampilkan hasilnya.

Anda dapat langsung menyalinnya atau memilih format ekspor.

Pengenalan PDF

Untuk halaman dokumen, PDF hasil ekspor dapat mempertahankan tampilan halaman sambil membuat teks tetap dapat dicari. Ini berguna untuk mengarsipkan pindaian dan menemukan konten nanti.

Memilih Format Ekspor

FormatCocok Untuk
Markdown (.md)Catatan, sistem dokumentasi, dan pengeditan lanjutan.
PDF (.pdf)Mempertahankan tampilan halaman dan hasil dokumen pindaian.
Word (.docx)Melanjutkan pengeditan tata letak, mengubah teks, dan menyerahkan ke orang lain.
Ekspor semuaMenyimpan beberapa format dan gambar asli, cocok untuk arsip penting.

Jika hanya membutuhkan teks, ekspor Markdown.

Jika perlu mempertahankan tampilan halaman, gunakan PDF atau Word.

Output Word

Dokumen Word hasil ekspor dapat dibuka dan diedit dengan perangkat lunak perkantoran.

Hasil Word

Beberapa dokumen menyertakan gambar, judul, dan paragraf yang dikenali di output Word.

Kualitas pengenalan bergantung pada kejernihan gambar asli, pilihan model, dan kompleksitas dokumen.

Jenis File Terbaik untuk OCR

Jenis FileRekomendasi
Tangkapan layar jelasKenali langsung.
PindaianUtamakan PP-StructureV3.
Dokumen yang difotoAktifkan koreksi orientasi dan perataan dokumen.
Tabel, rumus, capUtamakan model terstruktur.
Gambar teks pendek sederhanaPP-OCRv5 biasanya cukup.

Gambar yang lebih jelas dengan teks yang lebih lurus biasanya menghasilkan hasil yang lebih baik.

Kasus Umum

KasusArti
Pengenalan gagalPeriksa apakah token atau kunci layanan sudah disimpan.
Pengenalan lambatDokumen kompleks dan gambar besar membutuhkan waktu lebih lama.
Tabel tidak lengkapCoba model terstruktur.
Teks memiliki kesalahanBuram, pantulan cahaya, dan kemiringan meningkatkan kesalahan pengenalan. Coba gambar yang lebih jelas.
Output Word berisi banyak gambarModel terstruktur dapat mempertahankan sebagian gambar yang dikenali. Ini normal.

Kueri Kuota Google Gagal

Periksa:

  1. Akun layanan JSON sudah diimpor.
  2. Akun layanan memiliki peran Monitoring Viewer.
  3. Cloud Vision API sudah diaktifkan untuk project tersebut.

Jika Anda hanya membutuhkan OCR dan tidak membutuhkan kueri penggunaan, Anda dapat mengabaikan JSON akun layanan dan hanya mengisi Google Vision API Key.

Alur Cepat

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.