From 289e4025ad61df4fbdec2ff2d340b39b4b38cb17 Mon Sep 17 00:00:00 2001 From: Jim Barlow Date: Thu, 23 Jul 2015 23:28:32 -0700 Subject: [PATCH] First successful PDF/A produced by new pipeline --- src/ocrmypdf.py | 7 ++++--- 1 file changed, 4 insertions(+), 3 deletions(-) diff --git a/src/ocrmypdf.py b/src/ocrmypdf.py index 0d24ff47..e424c20d 100755 --- a/src/ocrmypdf.py +++ b/src/ocrmypdf.py @@ -22,7 +22,7 @@ except ImportError: from ruffus import transform, suffix, merge, active_if, regex, jobs_limit, \ - mkdir, formatter, follows, subdivide, collate + mkdir, formatter, follows, subdivide, collate, check_if_uptodate import ruffus.cmdline as cmdline from .hocrtransform import HocrTransform @@ -449,7 +449,7 @@ def ocr_tesseract( @collate( input=[rasterize_with_ghostscript, ocr_tesseract], - filter=regex(r"(\d{6})(?:\.page\.png)|(?:\.hocr)"), + filter=regex(r".*/(\d{6})(?:\.page\.png|\.hocr)"), output=r'\1.rendered.pdf', extras=[_log, _pdfinfo, _pdfinfo_lock]) def render_page( @@ -458,7 +458,8 @@ def render_page( log, pdfinfo, pdfinfo_lock): - image, hocr = infiles[0], infiles[1] + hocr = [ii for ii in infiles if ii.endswith('.hocr')][0] + image = [ii for ii in infiles if ii.endswith('.png')][0] pageinfo = get_pageinfo(image, pdfinfo, pdfinfo_lock) dpi = round(max(pageinfo['xres'], pageinfo['yres']))