Ver la Versión Completa : [Sintaxis] leer informacion desde un pdf.
dmosca
28 de marzo de 2021, 16:45
Buen dia
tengo facturas de proveedores en archivos pdf, necesito leer información que contienen los pdf.
Ej: datos del emisor, número de orden de compra, importes.
se puede desde Powercobol V9?
muchas gracias.
Joseg
28 de marzo de 2021, 20:28
Recomendo:
GitHub - tesseract-ocr/tesseract: Tesseract Open Source OCR Engine (main repository) (https://github.com/tesseract-ocr/tesseract)
Binários, recomendo a versão 4.1.1
Index of /tesseract (https://digi.bib.uni-mannheim.de/tesseract/)
Por command line funciona muito bem com o Powercobol
Command Line Usage | tessdoc (https://tesseract-ocr.github.io/tessdoc/Command-Line-Usage.html)
ex:
INVOKE pow-self "Execute" USING "tesseract imagename outputbase"
ver tb:
https://erik.joling.me/2019/03/09/converting-a-pdf-or-image-to-text-using-tesseract-ocr-on-ubuntu/
dmosca
31 de marzo de 2021, 18:21
Estimados
estuve viendo lo que dice JOSEG, pero es para archivos jpg, aclara que no lee pdf.
estamos trabajando con legajos digitales y todos los archivos estan en pdf, no puedo pasar todo a imagen...
alguna otra opción?
Joseg
1 de abril de 2021, 10:37
Estimados
estuve viendo lo que dice JOSEG, pero es para archivos jpg, aclara que no lee pdf.
estamos trabajando con legajos digitales y todos los archivos estan en pdf, no puedo pasar todo a imagen...
alguna otra opción?
Ahh ok,
Se for apenas para extrair texto, há muitas ferramentas gratuitas.
Por exemplo: GitHub - jamalmazrui/PDF2TXT: Batch convert PDF files to text under Windows, using several text extraction methods or OCR (https://github.com/jamalmazrui/PDF2TXT#installation)
ou procurar no google
"free command line windows pdf to text"
Também existem vários OCX pagos que fazem o mesmo.
vBulletin v3.8.7, Derechos ©2000-2026, Jelsoft Enterprises Ltd.