Skip to content

OCR

OCR; görsellerden, taramalardan ve belge ekran görüntülerinden metin çıkarır.

Tanıma sonrasında sonucu kopyalayabilir, Markdown, PDF veya Word olarak dışa aktarabilir ya da birden fazla biçimi birlikte paketleyip indirebilirsiniz.

OCR Neler Yapabilir?

ÖzellikAçıklama
Görsel metin tanımaGörsellerden, ekran görüntülerinden ve taramalardan metin çıkarır.
Belge düzeni tanımaTablolar, formüller, damgalar ve karışık metin-görsel düzenleri için daha uygundur.
Birden fazla hizmetBaidu PaddleOCR, Microsoft Azure Vision ve Google Vision destekler.
Sonuçları kopyalamaİşleme sonrasında tanınan metni kopyalar.
Dosya dışa aktarmaMarkdown, PDF ve Word dışa aktarır.
Toplu paketlemeBirden fazla dosya tanındıktan sonra sonuçları paket olarak indirir.

Önce OCR Hizmetlerini Yapılandırın

Açın:

text
System Settings -> Other Settings -> OCR

IP coğrafi konumu ve OCR

Kullanmak istediğiniz hizmetler için kimlik bilgilerini doldurun:

HizmetGirilecek BilgiEn Uygun Kullanım
Baidu PaddleOCRPaddleOCR TokenÖnerilen ilk tercih. Belgeler, görseller, tablolar ve karışık düzenler için iyidir.
Microsoft Azure VisionAzure Vision Endpoint ve Azure Vision API KeyMicrosoft bulut hizmetlerini zaten kullanıyorsanız yararlıdır.
Google VisionGoogle Vision API Key. Hizmet hesabı JSON yalnızca kota sorgusu için kullanılır.Google Cloud hizmetlerini kullanıyorsanız yararlıdır.

Kimlik bilgilerini doldurduktan sonra kaydedin.

İlk test için yalnızca bir hizmet yapılandırabilirsiniz. Üçünü de yapılandırmanız gerekmez.

Google Vision Kurulumu

Google kurulumu iki bölümden oluşur:

AmaçGereksinim
OCR kullanmakCloud Vision API etkinleştirin, ardından bir API Key oluşturun.
Kullanımı sorgulamakBir hizmet hesabı oluşturun, Monitoring Viewer verin, ardından hizmet hesabı JSON indirin.

Google API anahtarı ve hizmet hesabı

OCR İçin Google Kullanma

  1. Google Cloud Console'u açın.
  2. APIs & Services bölümüne gidin.
  3. Library bölümünü açın, Cloud Vision API arayın ve etkinleştirin.
  4. Credentials bölümüne dönün.
  5. Bir API Key oluşturun.
  6. API Key'i açıp kopyalayın.
  7. ImgHost'de Google Vision API Key alanına yapıştırın.
  8. Kaydedin.

Ardından OCR iletişim kutusunda Google Vision'ı seçebilirsiniz.

Google Kullanımını Sorgulama

Kota sorgusu tanıma için gerekli değildir.

Yalnızca son 30 günde yaklaşık kaç Google Vision çağrısı kullanıldığını gösterir.

  1. Google Cloud Console'da IAM & Admin bölümünü açın.
  2. Service Accounts bölümünü açın.
  3. vision-monitor gibi bir hizmet hesabı oluşturun.
  4. Ona Monitoring Viewer rolünü verin.
  5. Hizmet hesabı ayrıntılarını açın ve bir anahtar oluşturun.
  6. JSON seçin.
  7. Oluşturulan JSON dosyasını indirin.
  8. ImgHost'e dönüp hizmet hesabı JSON altında içe aktarın (isteğe bağlı).
  9. İçe aktarma başarılı olduktan sonra kota sorgusuna tıklayın.

İçe aktarmadan sonra ImgHost, hizmet hesabının ait olduğu proje adını gösterir. Kullanım sorgulanırken ImgHost Google izleme verilerini okur ve bu ayın çağrı sayısını gösterir.

Kısaca:

ÖğeAmaç
Google Vision API KeyOCR tanımasını gerçekleştirir.
Hizmet hesabı JSONKaç Google Vision çağrısı kullanıldığını sorgular.
Monitoring Viewer rolüHizmet hesabının kullanım verilerini okumasına izin verir.

Baidu PaddleOCR Token Alma

Baidu PaddleOCR bir erişim token'ı gerektirir.

PaddleOCR token'ı alma

Baidu PaddleOCR sayfasında API çağrı penceresini açın, token almak için tıklayın ve kopyalayın.

ImgHost'e dönün, PaddleOCR Token alanına yapıştırın ve kaydedin.

Tanımayı Başlatma

Dosya Yönetimi'nde bir görsel veya belge ekran görüntüsü seçin ve OCR öğesine tıklayın.

OCR tanıma

İletişim kutusunda tanıma hizmetini ve modeli seçin.

Yaygın PaddleOCR model seçenekleri:

ModelEn Uygun Kullanım
PP-StructureV3Önerilen varsayılan. Belgeler, tablolar, formüller, damgalar ve karışık düzenler için iyidir.
PP-OCRv5Basit görseller, sıradan metin ve hafif tanıma.
PaddleOCR-VLÇok dilli, karmaşık görseller ve grafik benzeri içerikler.
PaddleOCR-VL-1.5Daha karmaşık belge sayfaları ve düzen kurtarma.

Emin değilseniz PP-StructureV3 ile başlayın.

Gelişmiş Seçenekler

SeçenekAçıklama
Yön düzeltmeGörsel döndürülmüş veya eğriyse kullanın.
Belge düzleştirmeEğrilik veya eğim içeren fotoğraflanmış belgeler için kullanın.
Düzen algılamaBaşlıkları, paragrafları, tabloları ve görsel yapısını korumak istediğinizde kullanın.
Grafik tanımaGörsel grafikler veya karmaşık yapılar içeriyorsa kullanın.
Markdown güzelleştirmeDışa aktarılan Markdown'ın okunmasını kolaylaştırır.

Normal ekran görüntüleri için seçenekleri az tutun. Belge taramaları için belgeyle ilgili daha fazla seçeneği etkinleştirin.

Sonuçları Görüntüleme

Tanıma bittikten sonra iletişim kutusu sonucu gösterir.

Sonucu doğrudan kopyalayabilir veya dışa aktarma biçimlerini seçebilirsiniz.

PDF tanıma

Belge sayfaları için dışa aktarılan PDF, sayfa görünümünü korurken metni aranabilir tutabilir. Bu, taramaları arşivlemek ve içeriği daha sonra bulmak için yararlıdır.

Dışa Aktarma Biçimi Seçme

BiçimEn Uygun Kullanım
Markdown (.md)Notlar, dokümantasyon sistemleri ve sonraki düzenleme.
PDF (.pdf)Sayfa görünümünü ve taranmış belge sonuçlarını koruma.
Word (.docx)Düzeni düzenlemeye devam etme, metin değiştirme ve başkalarına devretme.
Tümünü dışa aktarBirden fazla biçimi ve özgün görseli kaydeder; önemli arşivler için uygundur.

Yalnızca metne ihtiyacınız varsa Markdown dışa aktarın.

Sayfa görünümüne ihtiyacınız varsa PDF veya Word kullanın.

Word Çıktısı

Dışa aktarılan Word belgeleri ofis yazılımlarında açılıp düzenlenebilir.

Word sonucu

Bazı belgeler Word çıktısında tanınan görseller, başlıklar ve paragraflar içerebilir.

Tanıma kalitesi özgün görselin netliğine, model seçimine ve belgenin karmaşıklığına bağlıdır.

OCR İçin En İyi Dosya Türleri

Dosya TürüÖneri
Net ekran görüntüleriDoğrudan tanıyın.
TaramalarPP-StructureV3 tercih edin.
Fotoğraflanmış belgelerYön düzeltme ve belge düzleştirmeyi etkinleştirin.
Tablolar, formüller, damgalarYapılandırılmış modelleri tercih edin.
Basit kısa metin görselleriPP-OCRv5 genellikle yeterlidir.

Daha net görseller ve daha düz metin genellikle daha iyi sonuç verir.

Yaygın Durumlar

DurumAnlam
Tanıma başarısızHizmet token'ının veya anahtar değerinin kaydedilip kaydedilmediğini kontrol edin.
Tanıma yavaşKarmaşık belgeler ve büyük görseller daha uzun sürer.
Tablo eksikYapılandırılmış bir model deneyin.
Metinde hatalar varBulanıklık, parlama ve eğrilik tanıma hatalarını artırır. Daha net bir görsel deneyin.
Word çıktısı çok sayıda görsel içeriyorYapılandırılmış modeller bazı tanınan görselleri koruyabilir. Bu normaldir.

Google Kota Sorgusu Başarısız

Kontrol edin:

  1. Hizmet hesabı JSON içe aktarılmış olmalı.
  2. Hizmet hesabında Monitoring Viewer rolü olmalı.
  3. Projede Cloud Vision API etkin olmalı.

Yalnızca OCR'ye ihtiyacınız varsa ve kullanım sorgusu gerekmiyorsa hizmet hesabı JSON'ını yok sayıp yalnızca Google Vision API Key doldurabilirsiniz.

Hızlı Akış

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.