Skip to content

OCR

OCR은 이미지, 스캔, 문서 스크린샷에서 텍스트를 추출합니다.

인식 후에는 결과를 복사하거나 Markdown, PDF, Word로 내보내거나, 여러 형식을 함께 묶어 다운로드할 수 있습니다.

OCR로 할 수 있는 일

기능설명
이미지 텍스트 인식이미지, 스크린샷, 스캔에서 텍스트를 추출합니다.
문서 레이아웃 인식표, 수식, 도장, 텍스트-이미지 혼합 레이아웃에 더 적합합니다.
여러 서비스Baidu PaddleOCR, Microsoft Azure Vision, Google Vision을 지원합니다.
결과 복사처리 후 인식된 텍스트를 복사합니다.
파일 내보내기Markdown, PDF, Word를 내보냅니다.
일괄 패키징여러 파일을 인식한 뒤 결과를 패키지로 다운로드합니다.

먼저 OCR 서비스 설정하기

엽니다:

text
System Settings -> Other Settings -> OCR

IP 위치 조회와 OCR

사용할 서비스의 인증 정보를 입력합니다.

서비스입력할 내용적합한 용도
Baidu PaddleOCRPaddleOCR Token첫 번째 선택지로 권장됩니다. 문서, 이미지, 표, 혼합 레이아웃에 좋습니다.
Microsoft Azure VisionAzure Vision EndpointAzure Vision API Key이미 Microsoft 클라우드 서비스를 사용하는 경우 유용합니다.
Google VisionGoogle Vision API Key. 서비스 계정 JSON은 할당량 조회에만 사용됩니다.Google Cloud 서비스를 사용하는 경우 유용합니다.

인증 정보를 입력한 뒤 저장합니다.

초기 테스트에는 서비스 하나만 설정해도 됩니다. 세 가지를 모두 설정할 필요는 없습니다.

Google Vision 설정

Google 설정은 두 부분으로 나뉩니다.

목표필요 사항
OCR 사용Cloud Vision API를 활성화한 뒤 API Key를 만듭니다.
사용량 조회서비스 계정을 만들고 Monitoring Viewer를 부여한 뒤 서비스 계정 JSON을 다운로드합니다.

Google API 키와 서비스 계정

OCR에 Google 사용하기

  1. Google Cloud Console을 엽니다.
  2. APIs & Services로 이동합니다.
  3. Library를 열고 Cloud Vision API를 검색해 활성화합니다.
  4. Credentials로 돌아갑니다.
  5. API Key를 만듭니다.
  6. API Key를 열어 복사합니다.
  7. ImgHost의 Google Vision API Key에 붙여 넣습니다.
  8. 저장합니다.

그런 다음 OCR 대화 상자에서 Google Vision을 선택할 수 있습니다.

Google 사용량 조회하기

할당량 조회는 인식에 필수는 아닙니다.

최근 30일 동안 사용된 Google Vision 호출 수를 대략적으로 보여 줄 뿐입니다.

  1. Google Cloud Console에서 IAM & Admin을 엽니다.
  2. Service Accounts를 엽니다.
  3. vision-monitor 같은 서비스 계정을 만듭니다.
  4. Monitoring Viewer 역할을 부여합니다.
  5. 서비스 계정 세부 정보로 들어가 키를 만듭니다.
  6. JSON을 선택합니다.
  7. 생성된 JSON 파일을 다운로드합니다.
  8. ImgHost로 돌아가 서비스 계정 JSON으로 가져옵니다(선택 사항).
  9. 가져오기에 성공하면 할당량 조회를 클릭합니다.

가져온 뒤 ImgHost는 서비스 계정이 속한 프로젝트 이름을 표시합니다. 사용량을 조회할 때 ImgHost는 Google 모니터링 데이터를 읽고 이번 달 호출 수를 표시합니다.

요약:

항목목적
Google Vision API KeyOCR 인식을 수행합니다.
서비스 계정 JSON사용된 Google Vision 호출 수를 조회합니다.
Monitoring Viewer 역할서비스 계정이 사용량 데이터를 읽을 수 있게 합니다.

Baidu PaddleOCR Token 받기

Baidu PaddleOCR에는 액세스 토큰이 필요합니다.

PaddleOCR 토큰 받기

Baidu PaddleOCR 페이지에서 API 호출 창을 열고 토큰 받기를 클릭한 뒤 복사합니다.

ImgHost로 돌아와 PaddleOCR Token에 붙여 넣고 저장합니다.

인식 시작하기

파일 관리에서 이미지 또는 문서 스크린샷을 선택하고 OCR을 클릭합니다.

OCR 인식

대화 상자에서 인식 서비스와 모델을 선택합니다.

일반적인 PaddleOCR 모델 선택:

모델적합한 용도
PP-StructureV3권장 기본값입니다. 문서, 표, 수식, 도장, 혼합 레이아웃에 좋습니다.
PP-OCRv5단순 이미지, 일반 텍스트, 가벼운 인식.
PaddleOCR-VL다국어, 복잡한 이미지, 차트와 유사한 콘텐츠.
PaddleOCR-VL-1.5더 복잡한 문서 페이지와 레이아웃 복원.

확실하지 않다면 PP-StructureV3부터 시작하세요.

고급 옵션

옵션설명
방향 보정이미지가 회전했거나 기울어진 경우 사용합니다.
문서 평탄화휘어짐이나 기울기가 있는 촬영 문서에 사용합니다.
레이아웃 감지제목, 문단, 표, 이미지 구조를 보존하고 싶을 때 사용합니다.
차트 인식이미지에 차트나 복잡한 구조가 있을 때 사용합니다.
Markdown 정리내보낸 Markdown을 더 읽기 쉽게 만듭니다.

일반 스크린샷에는 옵션을 최소한으로 유지합니다. 문서 스캔에는 문서 관련 옵션을 더 많이 활성화합니다.

결과 보기

인식이 끝나면 대화 상자에 결과가 표시됩니다.

바로 복사하거나 내보내기 형식을 선택할 수 있습니다.

PDF 인식

문서 페이지의 경우 내보낸 PDF는 페이지 모양을 유지하면서 텍스트 검색이 가능하게 할 수 있습니다. 스캔 보관과 나중에 내용 검색에 유용합니다.

내보내기 형식 선택

형식적합한 용도
Markdown (.md)노트, 문서화 시스템, 이후 편집.
PDF (.pdf)페이지 모양과 스캔 문서 결과 보존.
Word (.docx)레이아웃 편집 계속하기, 텍스트 수정, 다른 사람에게 전달.
모두 내보내기여러 형식과 원본 이미지를 저장하며 중요한 보관에 적합합니다.

텍스트만 필요하면 Markdown으로 내보냅니다.

페이지 모양이 필요하면 PDF 또는 Word를 사용합니다.

Word 출력

내보낸 Word 문서는 오피스 소프트웨어에서 열고 편집할 수 있습니다.

Word 결과

일부 문서에는 인식된 이미지, 제목, 문단이 Word 출력에 포함됩니다.

인식 품질은 원본 이미지의 선명도, 모델 선택, 문서 복잡도에 따라 달라집니다.

OCR에 적합한 파일 유형

파일 유형권장 사항
선명한 스크린샷바로 인식합니다.
스캔PP-StructureV3를 우선 사용합니다.
촬영한 문서방향 보정과 문서 평탄화를 활성화합니다.
표, 수식, 도장구조화 모델을 우선 사용합니다.
간단한 짧은 텍스트 이미지보통 PP-OCRv5로 충분합니다.

더 선명하고 텍스트가 더 반듯한 이미지는 보통 더 좋은 결과를 냅니다.

일반적인 경우

경우의미
인식 실패서비스 토큰 또는 키가 저장되어 있는지 확인합니다.
인식이 느림복잡한 문서와 큰 이미지는 시간이 더 걸립니다.
표가 불완전함구조화 모델을 시도합니다.
텍스트에 오류가 있음흐림, 반사, 기울기는 인식 오류를 늘립니다. 더 선명한 이미지를 시도하세요.
Word 출력에 이미지가 많음구조화 모델은 일부 인식된 이미지를 보존할 수 있습니다. 정상입니다.

Google 할당량 조회 실패

다음을 확인하세요.

  1. 서비스 계정 JSON을 가져왔습니다.
  2. 서비스 계정에 Monitoring Viewer 역할이 있습니다.
  3. 프로젝트에서 Cloud Vision API가 활성화되어 있습니다.

OCR만 필요하고 사용량 조회가 필요 없다면 서비스 계정 JSON은 무시하고 Google Vision API Key만 입력해도 됩니다.

빠른 흐름

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.