Skip to content

OCR

OCR ดึงข้อความจากรูปภาพ สแกน และภาพหน้าจอของเอกสาร

หลังรู้จำแล้ว คุณสามารถคัดลอกผลลัพธ์ ส่งออกเป็น Markdown, PDF หรือ Word หรือรวมหลายรูปแบบเป็นแพ็กเกจเพื่อดาวน์โหลดได้

OCR ทำอะไรได้บ้าง

ฟีเจอร์คำอธิบาย
รู้จำข้อความในรูปภาพดึงข้อความจากรูปภาพ ภาพหน้าจอ และสแกน
รู้จำเลย์เอาต์เอกสารเหมาะกับตาราง สูตร ตราประทับ และเลย์เอาต์ที่ผสมข้อความกับรูปภาพ
หลายบริการรองรับ Baidu PaddleOCR, Microsoft Azure Vision และ Google Vision
คัดลอกผลลัพธ์คัดลอกข้อความที่รู้จำได้หลังประมวลผล
ส่งออกไฟล์ส่งออก Markdown, PDF และ Word
รวมเป็นแพ็กเกจแบบชุดหลังรู้จำหลายไฟล์แล้ว สามารถดาวน์โหลดผลลัพธ์เป็นแพ็กเกจ

ตั้งค่าบริการ OCR ก่อน

เปิด:

text
System Settings -> Other Settings -> OCR

การระบุตำแหน่งจาก IP และ OCR

กรอกข้อมูลรับรองสำหรับบริการที่ต้องการใช้:

บริการสิ่งที่ต้องกรอกเหมาะที่สุดสำหรับ
Baidu PaddleOCRPaddleOCR Tokenตัวเลือกแรกที่แนะนำ เหมาะกับเอกสาร รูปภาพ ตาราง และเลย์เอาต์ผสม
Microsoft Azure VisionAzure Vision Endpoint และ Azure Vision API Keyมีประโยชน์หากคุณใช้บริการคลาวด์ของ Microsoft อยู่แล้ว
Google VisionGoogle Vision API Key โดยบัญชีบริการ JSON ใช้เฉพาะสำหรับตรวจสอบโควตามีประโยชน์หากคุณใช้บริการ Google Cloud

บันทึกหลังกรอกข้อมูลรับรองแล้ว

สำหรับการทดสอบครั้งแรก คุณตั้งค่าเพียงบริการเดียวก็ได้ ไม่จำเป็นต้องตั้งค่าทั้งสามบริการ

การตั้งค่า Google Vision

การตั้งค่า Google มีสองส่วน:

เป้าหมายข้อกำหนด
ใช้ OCRเปิดใช้ Cloud Vision API แล้วสร้าง API Key
ตรวจสอบการใช้งานสร้างบัญชีบริการ ให้สิทธิ์ Monitoring Viewer แล้วดาวน์โหลดบัญชีบริการ JSON

คีย์ API และบัญชีบริการของ Google

ใช้ Google สำหรับ OCR

  1. เปิด Google Cloud Console
  2. ไปที่ APIs & Services
  3. เปิด Library ค้นหา Cloud Vision API แล้วเปิดใช้
  4. กลับไปที่ Credentials
  5. สร้าง API Key
  6. เปิด API Key แล้วคัดลอก
  7. วางลงใน Google Vision API Key ใน ImgHost
  8. บันทึก

จากนั้นคุณสามารถเลือก Google Vision ในกล่องโต้ตอบ OCR ได้

ตรวจสอบการใช้งาน Google

การตรวจสอบโควตาไม่จำเป็นต่อการรู้จำ

ใช้เพื่อแสดงโดยประมาณว่ามีการเรียก Google Vision ไปกี่ครั้งในช่วง 30 วันที่ผ่านมา

  1. ใน Google Cloud Console เปิด IAM & Admin
  2. เปิด Service Accounts
  3. สร้างบัญชีบริการ เช่น vision-monitor
  4. ให้บทบาท Monitoring Viewer
  5. เปิดรายละเอียดบัญชีบริการแล้วสร้างคีย์
  6. เลือก JSON
  7. ดาวน์โหลดไฟล์ JSON ที่สร้างขึ้น
  8. กลับไปที่ ImgHost แล้วนำเข้าไว้ใต้บัญชีบริการ JSON (ไม่บังคับ)
  9. เมื่อนำเข้าสำเร็จแล้ว คลิกตรวจสอบโควตา

หลังนำเข้า ImgHost จะแสดงชื่อโปรเจกต์ที่เป็นเจ้าของบัญชีบริการ เมื่อตรวจสอบการใช้งาน ImgHost จะอ่านข้อมูลการตรวจสอบของ Google และแสดงจำนวนการเรียกในเดือนนี้

สรุป:

รายการจุดประสงค์
Google Vision API Keyใช้ทำการรู้จำ OCR
บัญชีบริการ JSONตรวจสอบจำนวนการเรียก Google Vision ที่ใช้ไป
บทบาท Monitoring Viewerอนุญาตให้บัญชีบริการอ่านข้อมูลการใช้งาน

รับ Baidu PaddleOCR Token

Baidu PaddleOCR ต้องใช้โทเค็นการเข้าถึง

รับโทเค็น PaddleOCR

เปิดหน้าต่างเรียก API ในหน้า Baidu PaddleOCR คลิกเพื่อรับโทเค็นแล้วคัดลอก

กลับไปที่ ImgHost วางลงใน PaddleOCR Token แล้วบันทึก

เริ่มรู้จำ

ในตัวจัดการไฟล์ เลือกรูปภาพหรือภาพหน้าจอของเอกสาร แล้วคลิก OCR

การรู้จำ OCR

ในกล่องโต้ตอบ เลือกบริการและโมเดลรู้จำ

ตัวเลือกโมเดล PaddleOCR ที่พบบ่อย:

โมเดลเหมาะที่สุดสำหรับ
PP-StructureV3ค่าเริ่มต้นที่แนะนำ เหมาะกับเอกสาร ตาราง สูตร ตราประทับ และเลย์เอาต์ผสม
PP-OCRv5รูปภาพธรรมดา ข้อความทั่วไป และการรู้จำแบบเบา
PaddleOCR-VLหลายภาษา รูปภาพซับซ้อน และเนื้อหาลักษณะคล้ายแผนภูมิ
PaddleOCR-VL-1.5หน้าเอกสารที่ซับซ้อนมากขึ้นและการกู้คืนเลย์เอาต์

หากไม่แน่ใจ ให้เริ่มด้วย PP-StructureV3

ตัวเลือกขั้นสูง

ตัวเลือกคำอธิบาย
แก้แนวภาพใช้เมื่อรูปภาพหมุนหรือเอียง
ปรับเอกสารให้แบนใช้กับเอกสารที่ถ่ายภาพแล้วมีความโค้งหรือเอียง
ตรวจจับเลย์เอาต์ใช้เมื่อคุณต้องการรักษาโครงสร้างหัวข้อ ย่อหน้า ตาราง และรูปภาพ
รู้จำแผนภูมิใช้เมื่อรูปภาพมีแผนภูมิหรือโครงสร้างซับซ้อน
ปรับ Markdown ให้อ่านง่ายทำให้ Markdown ที่ส่งออกอ่านง่ายขึ้น

สำหรับภาพหน้าจอทั่วไป ให้เปิดตัวเลือกให้น้อยที่สุด สำหรับสแกนเอกสาร ให้เปิดตัวเลือกที่เกี่ยวกับเอกสารมากขึ้น

ดูผลลัพธ์

หลังรู้จำเสร็จ กล่องโต้ตอบจะแสดงผลลัพธ์

คุณสามารถคัดลอกโดยตรงหรือเลือกชนิดไฟล์ส่งออกได้

การรู้จำ PDF

สำหรับหน้าเอกสาร PDF ที่ส่งออกสามารถรักษาหน้าตาเอกสารไว้พร้อมทำให้ค้นหาข้อความได้ เหมาะสำหรับจัดเก็บไฟล์สแกนและค้นหาเนื้อหาในภายหลัง

เลือกรูปแบบส่งออก

รูปแบบเหมาะที่สุดสำหรับ
Markdown (.md)บันทึกย่อ ระบบเอกสาร และการแก้ไขภายหลัง
PDF (.pdf)รักษาหน้าตาเอกสารและผลลัพธ์ของเอกสารสแกน
Word (.docx)แก้เลย์เอาต์ต่อ แก้ข้อความ และส่งต่อให้ผู้อื่น
ส่งออกทั้งหมดบันทึกหลายรูปแบบและรูปภาพต้นฉบับ เหมาะกับเอกสารสำคัญ

หากต้องการเฉพาะข้อความ ให้ส่งออก Markdown

หากต้องการรักษาหน้าตาเอกสาร ให้ใช้ PDF หรือ Word

ผลลัพธ์ Word

เอกสาร Word ที่ส่งออกสามารถเปิดและแก้ไขด้วยซอฟต์แวร์สำนักงานได้

ผลลัพธ์ Word

เอกสารบางรายการอาจมีรูปภาพที่รู้จำได้ หัวข้อ และย่อหน้าอยู่ในผลลัพธ์ Word

คุณภาพการรู้จำขึ้นอยู่กับความชัดของรูปภาพต้นฉบับ การเลือกโมเดล และความซับซ้อนของเอกสาร

ประเภทไฟล์ที่เหมาะกับ OCR

ประเภทไฟล์คำแนะนำ
ภาพหน้าจอชัดเจนรู้จำโดยตรง
สแกนแนะนำ PP-StructureV3
เอกสารถ่ายภาพเปิดแก้แนวภาพและปรับเอกสารให้แบน
ตาราง สูตร ตราประทับแนะนำโมเดลเชิงโครงสร้าง
รูปภาพข้อความสั้นธรรมดาPP-OCRv5 มักเพียงพอ

รูปภาพที่ชัดกว่าและข้อความตรงกว่ามักให้ผลลัพธ์ดีกว่า

กรณีทั่วไป

กรณีความหมาย
รู้จำไม่สำเร็จตรวจสอบว่าโทเค็นหรือคีย์ของบริการถูกบันทึกแล้ว
รู้จำช้าเอกสารซับซ้อนและรูปภาพขนาดใหญ่ใช้เวลานานกว่า
ตารางไม่ครบลองใช้โมเดลเชิงโครงสร้าง
ข้อความมีข้อผิดพลาดภาพเบลอ แสงสะท้อน และความเอียงเพิ่มข้อผิดพลาดในการรู้จำ ลองใช้รูปภาพที่ชัดกว่า
ผลลัพธ์ Word มีรูปภาพจำนวนมากโมเดลเชิงโครงสร้างอาจเก็บรูปภาพที่รู้จำได้บางส่วนไว้ เป็นเรื่องปกติ

ตรวจสอบโควตา Google ไม่สำเร็จ

ตรวจสอบ:

  1. นำเข้าบัญชีบริการ JSON แล้ว
  2. บัญชีบริการมีบทบาท Monitoring Viewer
  3. เปิดใช้ Cloud Vision API สำหรับโปรเจกต์แล้ว

หากต้องการเฉพาะ OCR และไม่ต้องการตรวจสอบการใช้งาน คุณสามารถข้าม JSON ของบัญชีบริการและกรอกเฉพาะ Google Vision API Key

ขั้นตอนแบบย่อ

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.