PDA

Ver la Versión Completa : [Sintaxis] leer informacion desde un pdf.


dmosca
28 de marzo de 2021, 16:45
Buen dia

tengo facturas de proveedores en archivos pdf, necesito leer información que contienen los pdf.
Ej: datos del emisor, número de orden de compra, importes.
se puede desde Powercobol V9?

muchas gracias.

Joseg
28 de marzo de 2021, 20:28
Recomendo:
GitHub - tesseract-ocr/tesseract: Tesseract Open Source OCR Engine (main repository) (https://github.com/tesseract-ocr/tesseract)

Binários, recomendo a versão 4.1.1
Index of /tesseract (https://digi.bib.uni-mannheim.de/tesseract/)

Por command line funciona muito bem com o Powercobol
Command Line Usage | tessdoc (https://tesseract-ocr.github.io/tessdoc/Command-Line-Usage.html)

ex:

INVOKE pow-self "Execute" USING "tesseract imagename outputbase"

ver tb:
https://erik.joling.me/2019/03/09/converting-a-pdf-or-image-to-text-using-tesseract-ocr-on-ubuntu/

dmosca
31 de marzo de 2021, 18:21
Estimados

estuve viendo lo que dice JOSEG, pero es para archivos jpg, aclara que no lee pdf.
estamos trabajando con legajos digitales y todos los archivos estan en pdf, no puedo pasar todo a imagen...
alguna otra opción?

Joseg
1 de abril de 2021, 10:37
Estimados

estuve viendo lo que dice JOSEG, pero es para archivos jpg, aclara que no lee pdf.
estamos trabajando con legajos digitales y todos los archivos estan en pdf, no puedo pasar todo a imagen...
alguna otra opción?

Ahh ok,

Se for apenas para extrair texto, há muitas ferramentas gratuitas.
Por exemplo: GitHub - jamalmazrui/PDF2TXT: Batch convert PDF files to text under Windows, using several text extraction methods or OCR (https://github.com/jamalmazrui/PDF2TXT#installation)

ou procurar no google
"free command line windows pdf to text"

Também existem vários OCX pagos que fazem o mesmo.