Mac python3 环境下 完善pdf转jpg脚本

由于样本图片数据都是保存在pdf里,想拿到样本必须先把图片从pdf中提取出来,算是数据清洗中的一点小小的积累吧。

这里不得不吐槽一下公司存储图片的机制,业务员把jpg格式的照片放到word里,然后用工具把word保存为pdf,最后上传到公司服务器里,这简介反人类,不但丢失了图片头文件信息,还造成后期数据转换的大量时间资源的浪费,可能pdf格式会小一点,但是完全可以通过其他图片编码方式进行解决,我才疏学浅,不能理解其中的逻辑。

下面进入正题:
这里把初始报错信息贴出来,以便大家对症下药:

1ImportError: MagickWand shared library not found. 2You probably had not installed ImageMagick library. 3Try to install: brew install freetype imagemagick

细心的提示了,需要安装imagemagick 趟坑开始

1、安装 ImageMagick

mac环境下,如果直接使用

$ brew imagemagick

进行安装,默认会安装7.0.7-37版本,通过测试,这个版本修改了相关方法,在后面的脚本中会报错,于是需要安装im6,尝试了很多办法,有的通过编译安装,有的通过git命令获得历史版本安装,不过最方便的还是直接用brew 查看可安装的软件版本

$ brew search imagemagick

会直接列出所有历史版本

1=> Searching local taps... 2imagemagick@6 imagemagick 3==> Searching taps on GitHub... 4==> Searching blacklisted, migrated and deleted formulae...

而后选择对应的版本就可以了,这里安装im6

$ brew install imagemagick@6

安装成功后,发现程序中还是报错依旧。
经过多方查找原因,原来是im默认储存的目录不在系统检索的目录里,需要建立一个软连接(说白了就是在系统检索的目录里建立一个快捷方式)

$ ln -s /usr/local/Cellar/imagemagick@6/6.9.9-49/lib/libMagickWand-6.Q16.dylib /usr/local/lib/libMagickWand.dylib

后面步骤引用参考文章中的内容,在此感谢作者。

2、安装gs

$ brew install gs

3、安装wand

$ pip install wand

4、一码胜千言

1from wand.image import Image 2 3pdf_file = '.../example/a.pdf' 4 5def convert_pdf_to_jpg(file_name, pic_file=None, resolution=120): 6 # 转换函数,默认分辨率120 7 with Image(filename=file_name, resolution=resolution) as img: 8 print('pages = ', len(img.sequence)) 9 10 with img.convert('jpeg') as converted: 11 # 指定图片位置 12 if pic_file != None: 13 converted.save(filename=pic_file) 14 else: 15 # 同目录同文件名 16 converted.save(filename= '%s.jpg' % (file_name[:file_name.rindex('.')])) 17 18if __name__ == '__main__': 19 convert_pdf_to_jpg(pdf_file)

5、参考文章:

https://www.jianshu.com/p/1754ad695377

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

手写Java HashMap源码

HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程HashMap的使用教程22

2020年前端实用代码段,为你的工作保驾护航

有空的时候,自己总结了几个代码段,在开发中也经常使用,谢谢。1、使用解构获取json数据let jsonData  id: 1,status: "OK",data: 'a', 'b';let  id, status, data: number   jsonData;console.log(id, status, number )