Skip to content

OCR

OCR extrae texto de imágenes, escaneos y capturas de pantalla de documentos.

Después del reconocimiento, puede copiar el resultado, exportarlo como Markdown, PDF o Word, o empaquetar varios formatos para descargarlos juntos.

Qué puede hacer OCR

FunciónDescripción
Reconocimiento de texto en imágenesExtrae texto de imágenes, capturas de pantalla y escaneos.
Reconocimiento de diseño de documentosMejor para tablas, fórmulas, sellos y diseños mixtos de texto e imagen.
Varios serviciosAdmite Baidu PaddleOCR, Microsoft Azure Vision y Google Vision.
Copiar resultadosCopia el texto reconocido después del procesamiento.
Exportar archivosExporta Markdown, PDF y Word.
Empaquetado por lotesDespués de reconocer varios archivos, permite descargar los resultados como un paquete.

Configure primero los servicios de OCR

Abra:

text
System Settings -> Other Settings -> OCR

Geolocalización IP y OCR

Rellene las credenciales de los servicios que desea usar:

ServicioQué introducirMás adecuado para
Baidu PaddleOCRPaddleOCR TokenPrimera opción recomendada. Adecuado para documentos, imágenes, tablas y diseños mixtos.
Microsoft Azure VisionAzure Vision Endpoint y Azure Vision API KeyÚtil si ya usa servicios en la nube de Microsoft.
Google VisionGoogle Vision API Key. El JSON de cuenta de servicio solo se usa para consultar cuota.Útil si usa servicios de Google Cloud.

Guarde después de introducir las credenciales.

Puede configurar solo un servicio para la prueba inicial. No necesita los tres.

Configurar Google Vision

La configuración de Google tiene dos partes:

ObjetivoRequisito
Usar OCRActivar Cloud Vision API y luego crear una API Key.
Consultar usoCrear una cuenta de servicio, conceder Monitoring Viewer y luego descargar el JSON de la cuenta de servicio.

Google API key y cuenta de servicio

Usar Google para OCR

  1. Abra Google Cloud Console.
  2. Vaya a APIs & Services.
  3. Abra Library, busque Cloud Vision API y actívela.
  4. Vuelva a Credentials.
  5. Cree una API Key.
  6. Abra la API Key y cópiela.
  7. Péguela en Google Vision API Key dentro de ImgHost.
  8. Guarde.

Después podrá elegir Google Vision en el diálogo de OCR.

Consultar uso de Google

La consulta de cuota no es necesaria para el reconocimiento.

Solo muestra de forma aproximada cuántas llamadas a Google Vision se usaron en los últimos 30 días.

  1. En Google Cloud Console, abra IAM & Admin.
  2. Abra Service Accounts.
  3. Cree una cuenta de servicio, por ejemplo vision-monitor.
  4. Concédale el rol Monitoring Viewer.
  5. Abra los detalles de la cuenta de servicio y cree una clave.
  6. Elija JSON.
  7. Descargue el archivo JSON generado.
  8. Vuelva a ImgHost e impórtelo en la cuenta de servicio JSON (opcional).
  9. Cuando la importación se complete correctamente, haga clic en consulta de cuota.

Después de importar, ImgHost muestra el nombre del proyecto al que pertenece la cuenta de servicio. Al consultar el uso, ImgHost lee datos de supervisión de Google y muestra el número de llamadas de este mes.

En resumen:

ElementoPropósito
Google Vision API KeyEjecuta el reconocimiento OCR.
Cuenta de servicio JSONConsulta cuántas llamadas a Google Vision se usaron.
Rol Monitoring ViewerPermite que la cuenta de servicio lea datos de uso.

Obtener un Baidu PaddleOCR Token

Baidu PaddleOCR requiere un token de acceso.

Obtener token de PaddleOCR

Abra la ventana de llamada API en la página de Baidu PaddleOCR, haga clic para obtener un token y cópielo.

Vuelva a ImgHost, péguelo en PaddleOCR Token y guarde.

Iniciar reconocimiento

En Gestión de archivos, seleccione una imagen o captura de pantalla de documento y haga clic en OCR.

Reconocimiento OCR

En el diálogo, elija el servicio de reconocimiento y el modelo.

Opciones comunes de modelos PaddleOCR:

ModeloMás adecuado para
PP-StructureV3Valor predeterminado recomendado. Adecuado para documentos, tablas, fórmulas, sellos y diseños mixtos.
PP-OCRv5Imágenes simples, texto normal y reconocimiento ligero.
PaddleOCR-VLImágenes multilingües y complejas, y contenido de tipo gráfico.
PaddleOCR-VL-1.5Páginas de documentos más complejas y recuperación de la disposición.

Si no está seguro, empiece con PP-StructureV3.

Opciones avanzadas

OpciónDescripción
Corrección de orientaciónÚsela cuando la imagen esté girada o inclinada.
Aplanado de documentoÚselo para documentos fotografiados con curvatura o inclinación.
Detección de diseñoÚsela cuando quiera conservar encabezados, párrafos, tablas y estructura visual.
Reconocimiento de gráficosÚselo cuando la imagen contenga gráficos o estructuras complejas.
Mejorar MarkdownHace que el Markdown exportado sea más fácil de leer.

Para capturas de pantalla normales, mantenga las opciones al mínimo. Para escaneos de documentos, active más opciones relacionadas con documentos.

Ver resultados

Cuando termine el reconocimiento, el diálogo mostrará el resultado.

Puede copiarlo directamente o elegir formatos de exportación.

Reconocimiento PDF

En páginas de documentos, el PDF exportado puede conservar el aspecto de la página y mantener el texto apto para búsquedas. Esto es útil para archivar escaneos y encontrar contenido más adelante.

Elegir formato de exportación

FormatoMás adecuado para
Markdown (.md)Notas, sistemas de documentación y edición posterior.
PDF (.pdf)Conservar el aspecto de la página y los resultados de documentos escaneados.
Word (.docx)Continuar editando diseño y texto, y entregar a otras personas.
Exportar todoGuarda varios formatos y la imagen original; adecuado para archivos importantes.

Si solo necesita texto, exporte Markdown.

Si necesita conservar el aspecto de la página, use PDF o Word.

Salida de Word

Los documentos Word exportados pueden abrirse y editarse con software ofimático.

Resultado Word

Algunos documentos incluyen imágenes, encabezados y párrafos reconocidos en la salida de Word.

La calidad del reconocimiento depende de la claridad de la imagen original, la elección del modelo y la complejidad del documento.

Mejores tipos de archivo para OCR

Tipo de archivoRecomendación
Capturas de pantalla clarasReconocer directamente.
EscaneosPreferir PP-StructureV3.
Documentos fotografiadosActivar corrección de orientación y aplanado de documento.
Tablas, fórmulas, sellosPreferir modelos estructurados.
Imágenes simples de texto cortoPP-OCRv5 suele ser suficiente.

Las imágenes más claras y con texto más recto suelen producir mejores resultados.

Casos comunes

CasoSignificado
El reconocimiento fallaCompruebe que el token o la clave del servicio se haya guardado.
El reconocimiento es lentoLos documentos complejos y las imágenes grandes tardan más.
La tabla está incompletaPruebe un modelo estructurado.
El texto tiene erroresEl desenfoque, los reflejos y la inclinación aumentan los errores de reconocimiento. Pruebe con una imagen más clara.
La salida Word contiene muchas imágenesLos modelos estructurados pueden conservar algunas imágenes reconocidas. Es normal.

La consulta de cuota de Google falla

Compruebe:

  1. Que se haya importado la cuenta de servicio JSON.
  2. La cuenta de servicio tiene el rol Monitoring Viewer.
  3. Cloud Vision API está activada para el proyecto.

Si solo necesita OCR y no la consulta de uso, puede ignorar el JSON de cuenta de servicio y rellenar solo Google Vision API Key.

Flujo rápido

text
Open System Settings
-> Open Other Settings
-> Fill OCR service credentials
-> Save
-> Return to File Management
-> Select a file and click OCR
-> Choose a model
-> Wait for recognition
-> Copy results or export Markdown / PDF / Word

Released as user documentation for ImgHost.