OCR
OCR متن را از تصاویر، اسکنها و اسکرینشاتهای سند استخراج میکند.
پس از تشخیص، میتوانید نتیجه را کپی کنید، آن را بهصورت Markdown، PDF یا Word خروجی بگیرید، یا چند قالب را با هم در یک بسته برای دانلود آماده کنید.
OCR چه کارهایی انجام میدهد
| قابلیت | توضیح |
|---|---|
| تشخیص متن تصویر | متن را از تصاویر، اسکرینشاتها و اسکنها استخراج میکند. |
| تشخیص چیدمان سند | برای جدولها، فرمولها، مهرها و چیدمانهای ترکیبی متن و تصویر مناسبتر است. |
| چند سرویس | از Baidu PaddleOCR، Microsoft Azure Vision و Google Vision پشتیبانی میکند. |
| کپی نتایج | متن تشخیصدادهشده را پس از پردازش کپی میکند. |
| خروجی گرفتن از فایلها | Markdown، PDF و Word خروجی میگیرد. |
| بستهبندی دستهای | پس از تشخیص چند فایل، نتایج را بهصورت بسته دانلود میکند. |
ابتدا سرویسهای OCR را پیکربندی کنید
باز کنید:
text
System Settings -> Other Settings -> OCR
اعتبارنامههای سرویسهایی را که میخواهید استفاده کنید وارد کنید:
| سرویس | چه چیزی وارد شود | مناسب برای |
|---|---|---|
| Baidu PaddleOCR | PaddleOCR Token | گزینه پیشنهادی اول. مناسب اسناد، تصاویر، جدولها و چیدمانهای ترکیبی. |
| Microsoft Azure Vision | Azure Vision Endpoint و Azure Vision API Key | اگر از سرویسهای ابری Microsoft استفاده میکنید مفید است. |
| Google Vision | Google Vision API Key. حساب سرویس JSON فقط برای پرسوجوی سهمیه استفاده میشود. | اگر از سرویسهای Google Cloud استفاده میکنید مفید است. |
پس از وارد کردن اعتبارنامهها ذخیره کنید.
برای آزمایش اولیه، پیکربندی یک سرویس کافی است. لازم نیست هر سه سرویس را داشته باشید.
راهاندازی Google Vision
راهاندازی Google دو بخش دارد:
| هدف | نیازمندی |
|---|---|
| استفاده از OCR | فعال کردن Cloud Vision API و سپس ساخت API Key. |
| پرسوجوی مصرف | ساخت حساب سرویس، دادن نقش Monitoring Viewer و سپس دانلود JSON حساب سرویس. |

استفاده از Google برای OCR
- Google Cloud Console را باز کنید.
- به
APIs & Servicesبروید. Libraryرا باز کنید،Cloud Vision APIرا جستوجو و فعال کنید.- به
Credentialsبرگردید. - یک
API Keyبسازید. - API Key را باز و کپی کنید.
- آن را در ImgHost داخل
Google Vision API Keyجایگذاری کنید. - ذخیره کنید.
پس از آن میتوانید Google Vision را در گفتوگوی OCR انتخاب کنید.
پرسوجوی مصرف Google
پرسوجوی سهمیه برای خود تشخیص لازم نیست.
این فقط بهصورت تقریبی نشان میدهد در 30 روز گذشته چند فراخوانی Google Vision استفاده شده است.
- در Google Cloud Console،
IAM & Adminرا باز کنید. Service Accountsرا باز کنید.- یک حساب سرویس بسازید، مانند
vision-monitor. - نقش
Monitoring Viewerرا به آن بدهید. - جزئیات حساب سرویس را باز کنید و یک کلید بسازید.
JSONرا انتخاب کنید.- فایل JSON ساختهشده را دانلود کنید.
- به ImgHost برگردید و آن را در بخش حساب سرویس
JSONوارد کنید (اختیاری). - پس از موفقیت وارد کردن، روی پرسوجوی سهمیه کلیک کنید.
پس از وارد کردن، ImgHost نام پروژه مالک حساب سرویس را نشان میدهد. هنگام پرسوجوی مصرف، ImgHost دادههای پایش Google را میخواند و تعداد فراخوانیهای این ماه را نشان میدهد.
خلاصه:
| مورد | هدف |
|---|---|
Google Vision API Key | تشخیص OCR را اجرا میکند. |
حساب سرویس JSON | تعداد فراخوانیهای استفادهشده از Google Vision را پرسوجو میکند. |
نقش Monitoring Viewer | اجازه میدهد حساب سرویس دادههای مصرف را بخواند. |
دریافت Baidu PaddleOCR Token
Baidu PaddleOCR به توکن دسترسی نیاز دارد.

در صفحه Baidu PaddleOCR، پنجره فراخوانی API را باز کنید، برای دریافت توکن کلیک کنید و آن را کپی کنید.
به ImgHost برگردید، آن را در PaddleOCR Token جایگذاری کنید و ذخیره کنید.
شروع تشخیص
در مدیریت فایل، یک تصویر یا اسکرینشات سند انتخاب کنید و روی OCR کلیک کنید.

در گفتوگو، سرویس تشخیص و مدل را انتخاب کنید.
گزینههای رایج مدل PaddleOCR:
| مدل | مناسب برای |
|---|---|
PP-StructureV3 | پیشفرض پیشنهادی. مناسب اسناد، جدولها، فرمولها، مهرها و چیدمانهای ترکیبی. |
PP-OCRv5 | تصاویر ساده، متن معمولی و تشخیص سبک. |
PaddleOCR-VL | تصاویر چندزبانه و پیچیده و محتوای شبیه نمودار. |
PaddleOCR-VL-1.5 | صفحههای سند پیچیدهتر و بازیابی چیدمان. |
اگر مطمئن نیستید، با PP-StructureV3 شروع کنید.
گزینههای پیشرفته
| گزینه | توضیح |
|---|---|
| اصلاح جهت | وقتی تصویر چرخیده یا کج است استفاده کنید. |
| صافسازی سند | برای اسناد عکسبرداریشده با خمیدگی یا شیب استفاده کنید. |
| تشخیص چیدمان | وقتی میخواهید عنوانها، بندها، جدولها و ساختار تصویر حفظ شود استفاده کنید. |
| تشخیص نمودار | وقتی تصویر شامل نمودارها یا ساختارهای پیچیده است استفاده کنید. |
زیباسازی Markdown | Markdown خروجی را خواناتر میکند. |
برای اسکرینشاتهای معمولی، گزینهها را حداقلی نگه دارید. برای اسکنهای سند، گزینههای مرتبط با سند را بیشتر فعال کنید.
مشاهده نتایج
پس از پایان تشخیص، گفتوگو نتیجه را نشان میدهد.
میتوانید آن را مستقیم کپی کنید یا قالبهای خروجی را انتخاب کنید.

برای صفحههای سند، PDF خروجی میتواند ظاهر صفحه را حفظ کند و در عین حال متن را قابل جستوجو نگه دارد. این برای بایگانی اسکنها و یافتن محتوا در آینده مفید است.
انتخاب قالب خروجی
| قالب | مناسب برای |
|---|---|
Markdown (.md) | یادداشتها، سامانههای مستندسازی و ویرایش بعدی. |
PDF (.pdf) | حفظ ظاهر صفحه و نتایج اسناد اسکنشده. |
Word (.docx) | ادامه ویرایش چیدمان، تغییر متن و تحویل به دیگران. |
| خروجی گرفتن از همه | چند قالب و تصویر اصلی را ذخیره میکند؛ مناسب بایگانیهای مهم. |
اگر فقط متن لازم دارید، Markdown خروجی بگیرید.
اگر ظاهر صفحه مهم است، از PDF یا Word استفاده کنید.
خروجی Word
اسناد Word خروجی را میتوان با نرمافزارهای اداری باز و ویرایش کرد.

برخی اسناد در خروجی Word شامل تصاویر، عنوانها و بندهای تشخیصدادهشده هستند.
کیفیت تشخیص به وضوح تصویر اصلی، انتخاب مدل و پیچیدگی سند بستگی دارد.
بهترین نوع فایلها برای OCR
| نوع فایل | پیشنهاد |
|---|---|
| اسکرینشاتهای واضح | مستقیم تشخیص دهید. |
| اسکنها | PP-StructureV3 را ترجیح دهید. |
| اسناد عکسبرداریشده | اصلاح جهت و صافسازی سند را فعال کنید. |
| جدولها، فرمولها، مهرها | مدلهای ساختاریافته را ترجیح دهید. |
| تصاویر ساده با متن کوتاه | PP-OCRv5 معمولاً کافی است. |
تصاویر واضحتر با متن صافتر معمولاً نتایج بهتری میدهند.
موارد رایج
| مورد | معنی |
|---|---|
| تشخیص ناموفق است | بررسی کنید توکن یا کلید سرویس ذخیره شده باشد. |
| تشخیص کند است | اسناد پیچیده و تصاویر بزرگ زمان بیشتری میبرند. |
| جدول ناقص است | یک مدل ساختاریافته امتحان کنید. |
| متن خطا دارد | تاری، بازتاب نور و کجی خطاهای تشخیص را بیشتر میکنند. تصویر واضحتری امتحان کنید. |
| خروجی Word تصاویر زیادی دارد | مدلهای ساختاریافته ممکن است برخی تصاویر تشخیصدادهشده را حفظ کنند. این طبیعی است. |
پرسوجوی سهمیه Google ناموفق است
بررسی کنید:
- حساب سرویس
JSONوارد شده باشد. - حساب سرویس نقش
Monitoring Viewerداشته باشد. Cloud Vision APIبرای پروژه فعال باشد.
اگر فقط OCR لازم دارید و پرسوجوی مصرف نمیخواهید، میتوانید JSON حساب سرویس را نادیده بگیرید و فقط Google Vision API Key را پر کنید.
روند سریع
text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word