excel抓取多页网页数据( PDF转换成Excel文档的代码实战,希望大佬喜欢,哈哈 )

优采云 发布时间: 2021-11-06 14:13

  excel抓取多页网页数据(

PDF转换成Excel文档的代码实战,希望大佬喜欢,哈哈

)

  Python提取PDF页面数据并生成Excel文件

  我发现网上有网站专门做文档格式转换的,不过只要成为会员就可以了。今天,我将做一个PDF转Excel文档的实战。希望大家喜欢,哈哈,话不多说,我现在就进入实战。

  

  首先,我们将一如既往地介绍我们需要使用的第三方库。

  import pdfplumber # 专门处理PDF文档格式的文件对象

import pandas as pd # 数据处理库,常见的DtaFrame、Series数据对象处理

  然后提取对应的PDF数据保存在DataFrame数据对象中。

  # 打开PDF文件、得到PDF数据文件对象

pdf_obj = pdfplumber.open('data.pdf')

# 这里我们以获取第一页的PDF数据为例

page_1 = pdf_obj.pages[0]

# 从得到的第一页数据中提取表格数据

data_table = page_1.extract_table()

# 将提取到的数据表格转换为DataFrame数据对象

data_frame = pd.DataFrame(data_table)

# 打印查看DataFrame数据

print(data_frame)

  获取DataFrame数据对象后,需要进行数据处理的可以参考前面文章DataFrame数据处理相关知识点。

  最后,将准备好的DataFrame数据对象保存到Excel格式的数据文件中,大功告成。

  writer = pd.ExcelWriter('C:\\data.xlsx') # 设置文档路径

data_frame.to_excel(writer, index=None, startrow=1, encoding='utf-8',sheet_name='数据统计') # 设置Excel对象

ws = writer.sheets['数据统计'] # 写入工作表名称

ws.write_string(0, 0, '我是一个标题') # 添加标题

writer.save() # 保存

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线