办公自动化：轻松提取PDF页面数据，并生成Excel文件（代码实战）！

本文主要是介绍办公自动化：轻松提取PDF页面数据，并生成Excel文件（代码实战）！，对大家解决编程问题具有一定的参考价值，需要的程序猿们随着小编来一起学习吧！

发现网上有专门做文档格式转换的网站，不过是要充会员才可以。今天来做一篇PDF转换成Excel文档的代码实战，希望大佬喜欢，哈哈，话不多说，马上进入实战环节。

首先，我们一如既往的介绍一下需要用到的第三方库。

import pdfplumber  # 专门处理PDF文档格式的文件对象
import pandas as pd  # 数据处理库，常见的DtaFrame、Series数据对象处理

然后，再把相应的PDF数据提取出来并且保存在DataFrame数据对象中。

# 打开PDF文件、得到PDF数据文件对象
pdf_obj = pdfplumber.open('data.pdf')

# 这里我们以获取第一页的PDF数据为例
page_1 = pdf_obj.pages[0]

# 从得到的第一页数据中提取表格数据
data_table = page_1.extract_table()

# 将提取到的数据表格转换为DataFrame数据对象
data_frame = pd.DataFrame(data_table)

# 打印查看DataFrame数据
print(data_frame)

得到DataFrame数据对象之后，需要进行数据处理的话可以参考前面的文章DataFrame数据处理相关的知识点。

最后，将准备好的DataFrame数据对象保存成Excel格式的数据文件就大功告成啦。

writer = pd.ExcelWriter('C:\\data.xlsx') # 设置文档路径

data_frame.to_excel(writer, index=None, startrow=1, encoding='utf-8',sheet_name='数据统计')  # 设置Excel对象

ws = writer.sheets['数据统计']  # 写入工作表名称

ws.write_string(0, 0, '我是一个标题')  # 添加标题

writer.save()  # 保存

这篇关于办公自动化：轻松提取PDF页面数据，并生成Excel文件（代码实战）！的文章就介绍到这儿，希望我们推荐的文章对大家有所帮助，也希望大家多多支持为之网！

C/C++教程

办公自动化：轻松提取PDF页面数据，并生成Excel文件（代码实战）！

前端开发

后端开发

移动端开发

数据库

服务器运维

人工智能

区块链

游戏开发

网站运营

大数据/云计算

软件工程

软件/开发工具使用

资讯