Skip to content

OCR

OCR متن را از تصاویر، اسکن‌ها و اسکرین‌شات‌های سند استخراج می‌کند.

پس از تشخیص، می‌توانید نتیجه را کپی کنید، آن را به‌صورت Markdown، PDF یا Word خروجی بگیرید، یا چند قالب را با هم در یک بسته برای دانلود آماده کنید.

OCR چه کارهایی انجام می‌دهد

قابلیتتوضیح
تشخیص متن تصویرمتن را از تصاویر، اسکرین‌شات‌ها و اسکن‌ها استخراج می‌کند.
تشخیص چیدمان سندبرای جدول‌ها، فرمول‌ها، مهرها و چیدمان‌های ترکیبی متن و تصویر مناسب‌تر است.
چند سرویساز Baidu PaddleOCR، Microsoft Azure Vision و Google Vision پشتیبانی می‌کند.
کپی نتایجمتن تشخیص‌داده‌شده را پس از پردازش کپی می‌کند.
خروجی گرفتن از فایل‌هاMarkdown، PDF و Word خروجی می‌گیرد.
بسته‌بندی دسته‌ایپس از تشخیص چند فایل، نتایج را به‌صورت بسته دانلود می‌کند.

ابتدا سرویس‌های OCR را پیکربندی کنید

باز کنید:

text
System Settings -> Other Settings -> OCR

مکان‌یابی IP و OCR

اعتبارنامه‌های سرویس‌هایی را که می‌خواهید استفاده کنید وارد کنید:

سرویسچه چیزی وارد شودمناسب برای
Baidu PaddleOCRPaddleOCR Tokenگزینه پیشنهادی اول. مناسب اسناد، تصاویر، جدول‌ها و چیدمان‌های ترکیبی.
Microsoft Azure VisionAzure Vision Endpoint و Azure Vision API Keyاگر از سرویس‌های ابری Microsoft استفاده می‌کنید مفید است.
Google VisionGoogle Vision API Key. حساب سرویس JSON فقط برای پرس‌وجوی سهمیه استفاده می‌شود.اگر از سرویس‌های Google Cloud استفاده می‌کنید مفید است.

پس از وارد کردن اعتبارنامه‌ها ذخیره کنید.

برای آزمایش اولیه، پیکربندی یک سرویس کافی است. لازم نیست هر سه سرویس را داشته باشید.

راه‌اندازی Google Vision

راه‌اندازی Google دو بخش دارد:

هدفنیازمندی
استفاده از OCRفعال کردن Cloud Vision API و سپس ساخت API Key.
پرس‌وجوی مصرفساخت حساب سرویس، دادن نقش Monitoring Viewer و سپس دانلود JSON حساب سرویس.

کلید Google API و حساب سرویس

استفاده از Google برای OCR

  1. Google Cloud Console را باز کنید.
  2. به APIs & Services بروید.
  3. Library را باز کنید، Cloud Vision API را جست‌وجو و فعال کنید.
  4. به Credentials برگردید.
  5. یک API Key بسازید.
  6. API Key را باز و کپی کنید.
  7. آن را در ImgHost داخل Google Vision API Key جای‌گذاری کنید.
  8. ذخیره کنید.

پس از آن می‌توانید Google Vision را در گفت‌وگوی OCR انتخاب کنید.

پرس‌وجوی مصرف Google

پرس‌وجوی سهمیه برای خود تشخیص لازم نیست.

این فقط به‌صورت تقریبی نشان می‌دهد در 30 روز گذشته چند فراخوانی Google Vision استفاده شده است.

  1. در Google Cloud Console، IAM & Admin را باز کنید.
  2. Service Accounts را باز کنید.
  3. یک حساب سرویس بسازید، مانند vision-monitor.
  4. نقش Monitoring Viewer را به آن بدهید.
  5. جزئیات حساب سرویس را باز کنید و یک کلید بسازید.
  6. JSON را انتخاب کنید.
  7. فایل JSON ساخته‌شده را دانلود کنید.
  8. به ImgHost برگردید و آن را در بخش حساب سرویس JSON وارد کنید (اختیاری).
  9. پس از موفقیت وارد کردن، روی پرس‌وجوی سهمیه کلیک کنید.

پس از وارد کردن، ImgHost نام پروژه مالک حساب سرویس را نشان می‌دهد. هنگام پرس‌وجوی مصرف، ImgHost داده‌های پایش Google را می‌خواند و تعداد فراخوانی‌های این ماه را نشان می‌دهد.

خلاصه:

موردهدف
Google Vision API Keyتشخیص OCR را اجرا می‌کند.
حساب سرویس JSONتعداد فراخوانی‌های استفاده‌شده از Google Vision را پرس‌وجو می‌کند.
نقش Monitoring Viewerاجازه می‌دهد حساب سرویس داده‌های مصرف را بخواند.

دریافت Baidu PaddleOCR Token

Baidu PaddleOCR به توکن دسترسی نیاز دارد.

دریافت توکن PaddleOCR

در صفحه Baidu PaddleOCR، پنجره فراخوانی API را باز کنید، برای دریافت توکن کلیک کنید و آن را کپی کنید.

به ImgHost برگردید، آن را در PaddleOCR Token جای‌گذاری کنید و ذخیره کنید.

شروع تشخیص

در مدیریت فایل، یک تصویر یا اسکرین‌شات سند انتخاب کنید و روی OCR کلیک کنید.

تشخیص OCR

در گفت‌وگو، سرویس تشخیص و مدل را انتخاب کنید.

گزینه‌های رایج مدل PaddleOCR:

مدلمناسب برای
PP-StructureV3پیش‌فرض پیشنهادی. مناسب اسناد، جدول‌ها، فرمول‌ها، مهرها و چیدمان‌های ترکیبی.
PP-OCRv5تصاویر ساده، متن معمولی و تشخیص سبک.
PaddleOCR-VLتصاویر چندزبانه و پیچیده و محتوای شبیه نمودار.
PaddleOCR-VL-1.5صفحه‌های سند پیچیده‌تر و بازیابی چیدمان.

اگر مطمئن نیستید، با PP-StructureV3 شروع کنید.

گزینه‌های پیشرفته

گزینهتوضیح
اصلاح جهتوقتی تصویر چرخیده یا کج است استفاده کنید.
صاف‌سازی سندبرای اسناد عکس‌برداری‌شده با خمیدگی یا شیب استفاده کنید.
تشخیص چیدمانوقتی می‌خواهید عنوان‌ها، بندها، جدول‌ها و ساختار تصویر حفظ شود استفاده کنید.
تشخیص نموداروقتی تصویر شامل نمودارها یا ساختارهای پیچیده است استفاده کنید.
زیباسازی MarkdownMarkdown خروجی را خواناتر می‌کند.

برای اسکرین‌شات‌های معمولی، گزینه‌ها را حداقلی نگه دارید. برای اسکن‌های سند، گزینه‌های مرتبط با سند را بیشتر فعال کنید.

مشاهده نتایج

پس از پایان تشخیص، گفت‌وگو نتیجه را نشان می‌دهد.

می‌توانید آن را مستقیم کپی کنید یا قالب‌های خروجی را انتخاب کنید.

تشخیص PDF

برای صفحه‌های سند، PDF خروجی می‌تواند ظاهر صفحه را حفظ کند و در عین حال متن را قابل جست‌وجو نگه دارد. این برای بایگانی اسکن‌ها و یافتن محتوا در آینده مفید است.

انتخاب قالب خروجی

قالبمناسب برای
Markdown (.md)یادداشت‌ها، سامانه‌های مستندسازی و ویرایش بعدی.
PDF (.pdf)حفظ ظاهر صفحه و نتایج اسناد اسکن‌شده.
Word (.docx)ادامه ویرایش چیدمان، تغییر متن و تحویل به دیگران.
خروجی گرفتن از همهچند قالب و تصویر اصلی را ذخیره می‌کند؛ مناسب بایگانی‌های مهم.

اگر فقط متن لازم دارید، Markdown خروجی بگیرید.

اگر ظاهر صفحه مهم است، از PDF یا Word استفاده کنید.

خروجی Word

اسناد Word خروجی را می‌توان با نرم‌افزارهای اداری باز و ویرایش کرد.

نتیجه Word

برخی اسناد در خروجی Word شامل تصاویر، عنوان‌ها و بندهای تشخیص‌داده‌شده هستند.

کیفیت تشخیص به وضوح تصویر اصلی، انتخاب مدل و پیچیدگی سند بستگی دارد.

بهترین نوع فایل‌ها برای OCR

نوع فایلپیشنهاد
اسکرین‌شات‌های واضحمستقیم تشخیص دهید.
اسکن‌هاPP-StructureV3 را ترجیح دهید.
اسناد عکس‌برداری‌شدهاصلاح جهت و صاف‌سازی سند را فعال کنید.
جدول‌ها، فرمول‌ها، مهرهامدل‌های ساختاریافته را ترجیح دهید.
تصاویر ساده با متن کوتاهPP-OCRv5 معمولاً کافی است.

تصاویر واضح‌تر با متن صاف‌تر معمولاً نتایج بهتری می‌دهند.

موارد رایج

موردمعنی
تشخیص ناموفق استبررسی کنید توکن یا کلید سرویس ذخیره شده باشد.
تشخیص کند استاسناد پیچیده و تصاویر بزرگ زمان بیشتری می‌برند.
جدول ناقص استیک مدل ساختاریافته امتحان کنید.
متن خطا داردتاری، بازتاب نور و کجی خطاهای تشخیص را بیشتر می‌کنند. تصویر واضح‌تری امتحان کنید.
خروجی Word تصاویر زیادی داردمدل‌های ساختاریافته ممکن است برخی تصاویر تشخیص‌داده‌شده را حفظ کنند. این طبیعی است.

پرس‌وجوی سهمیه Google ناموفق است

بررسی کنید:

  1. حساب سرویس JSON وارد شده باشد.
  2. حساب سرویس نقش Monitoring Viewer داشته باشد.
  3. Cloud Vision API برای پروژه فعال باشد.

اگر فقط OCR لازم دارید و پرس‌وجوی مصرف نمی‌خواهید، می‌توانید JSON حساب سرویس را نادیده بگیرید و فقط Google Vision API Key را پر کنید.

روند سریع

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.