前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >一日一技:从PDF完美提取表格

一日一技:从PDF完美提取表格

作者头像
青南
发布2023-09-11 16:25:16
8690
发布2023-09-11 16:25:16
举报
文章被收录于专栏:未闻Code未闻Code

在之前很长一段时间,从PDF文件中提取表格都是一个老大难的问题。无论你使用的是PyPDF2还是其他什么第三方库,提取出来的表格都会变成纯文本,难以二次利用。

但现在好消息来了,专业处理PDF的第三方库PyMuPDF升级到了1.23.0,已经支持完美提取PDF中的表格了。还可以把表格转换为Pandas的DataFrame供你分析。

PyMuPDF的使用非常简单,首先我们来安装:

代码语言:javascript
复制
pip install pymupdf pandas openpyxl

其中安装pandas是为了能让它转成DataFrame,安装openpyxl是为了能把结果导出为Excel。

我们来看一个测试的PDF文件,如下图所示:

其中表格在第5页,那么我们编写如下代码,读取第五页的表格:

代码语言:javascript
复制
import fitz

doc = fitz.open('example.pdf')
page = doc[4] # 下标从0开始,第五页对应4
tables = page.find_tables()
df = tables[0].to_pandas()
df.to_excel('table.xlsx', index=False)

读取第5页的表格,把它转换为DataFrame,然后输出为Excel文件。

生成的Excel文件如下图所示,表格中的所有信息都完整读取,连换行符都能正常保留:

当然你也可以不输出成Excel,而是直接在代码里面对DataFrame进行分析。

END

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2023-08-31,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 未闻Code 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
腾讯云服务器利旧
云服务器(Cloud Virtual Machine,CVM)提供安全可靠的弹性计算服务。 您可以实时扩展或缩减计算资源,适应变化的业务需求,并只需按实际使用的资源计费。使用 CVM 可以极大降低您的软硬件采购成本,简化 IT 运维工作。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档