Python读取pdf表格写入excel的方法

背景

今天突然想到之前被要求做同性质银行的数据分析。妈耶!十几个银行,每个银行近5年的财务数据,而且财务报表一般都是 pdf 的,我们将 pdf 中表的数据一个个的拷贝到 excel 中,再借助 excel 去进行求和求平均等聚合函数操作,完事了还得把求出来的结果再统一 CV 到另一张表中,进行可视化分析…

当然,那时风流倜傥的 老Amy 还熟练的玩转着 excel ,也是个秀儿~ 今天就思索着,如果当年我会 Python 是不是可以让我成为班级最靓的崽!用技术占领高地,HHH,所以今天我来了,希望可以帮助大家解决同性质的问题。

开始学习叭

避免CV大法

pdf 文件的表格的数据可以复制,但是这是一项非常繁琐的事情。所以我首先考虑的是,Python 可否帮助我们高效且规范地读取 pdf 中的表格数据。所以一顿的检索,发现了一个比较优质处理 pdf 的库:pdfplumber,当然这个库需要大家 pip install pdfplumber 去进行安装。以及详细使用可参考全球最大基友社区:https://github.com/jsvine/pdfplumber

步骤:

  • 导入 pdfplumber 库
  • 通过 pdfplumber.open() 函数 获取 mt2018.pdf 文件对象
  • 通过该 对象.pages 获取 pdf 每页的对象,截取我们需要的页对象即可
  • 通过 页对象.extract_tables() 获取表格数据(若需要获取文本:页对象.extract_text())

代码实现:

import pdfplumber

# 获取 pdf 文件对象
pdf_mt = pdfplumber.open("mt2018.pdf")

# 因为我需要获取的资产负债表在 51-53页 但是索引从0开始 所以切片取 50-52即可
for pdf_pg in pdf_mt.pages[50:53]:

  # 只提取当前页表格数据
  print(pdf_pg.extract_tables())

--------------------------------------------------------------------------
结果比较多,截取一部分:
[[['项目', '附注', '期末余额', '期初余额'], ['流动资产:', '', '', ''], ['货币资金', '1', '112,074,791,420.06', '87,868,869,913.34'], ['结算备付金', '', '', ''], ['拆出资金', '', '', ''], ['以公允价值计量且其变动计入当\n期损益的金融资产', '', '', ''], ['衍生金融资产', '', '', ''], ['应收票据及应收账款', '2', '563,739,710.00', '1,221,706,039.00']]]

将完整表保存到 csv 文件中

我们发现,返回的数据集是一个三维的列表。那么在我们平时处理的 excel 表格数据(行与列)都是二维的数据。那么,这多出的一维是什么呢?其实就是我们的夜[页]~ 再来一个循环取出二维数据进行保存即可

for pdf_pg in pdf_mt.pages[50:53]:
  for pdf_tb in pdf_pg.extract_tables():
    print(pdf_tb)

------------------------------------------------------------------------------
结果比较多,截取一部分:
[['项目', '附注', '期末余额', '期初余额'], ['流动资产:', '', '', ''], ['货币资金', '1', '112,074,791,420.06', '87,868,869,913.34'], ['结算备付金', '', '', ''], ['拆出资金', '', '', ''], ['以公允价值计量且其变动计入当\n期损益的金融资产', '', '', ''], ['衍生金融资产', '', '', ''], ['应收票据及应收账款', '2', '563,739,710.00', '1,221,706,039.00']]

但是,真的那么简单吗?这时,我们就需要细品我们的 pdf 了,如下图

我们发现,一张完整的资产负债表分布在多页上。也就是说,每一页的里面的表格数据都是一个三维的列表,所以我们保存数据的时候,需要让其有共同的表头(列索引),并且进行拼接。

那必须就要强推我们的 pandas 了,pandas.DataFrame() 非常完美的创建表格式的二维数组,以及指定列索引(表头)。包括可以直接 使用 df.append() 进行共同表头数据的堆叠拼接。

import pdfplumber
import pandas as pd
import numpy as np

# 创建仅有表头的 dataframe 数组
pdf_df = pd.DataFrame(columns=['项目', '附注', '期末余额', '期初余额'])

# 获取 pdf 文件对象
pdf_mt = pdfplumber.open("mt2018.pdf")

# 因为我需要获取的资产负债表在 51-53页 但是索引从0开始 所以切片取 50-52即可
for pdf_pg in pdf_mt.pages[50:53]:

  # 获取二维列表
  for pdf_tb in pdf_pg.extract_tables():

    # 将其拼接
    pdf_df = pdf_df.append(pd.DataFrame(np.array(pdf_tb),columns=['项目', '附注', '期末余额', '期初余额']))

# 显示后五条
pdf_df.tail()

dataframe数据输出如下:

pdf 53页如下:

实际上,大家也发现,我们获取的最后一页的数据还有一部分是另一个表的,所以我们需要将其去除,并且有序的设置行索引,再保存到 csv 文件中。

# 去除后三行
pdf_df = pdf_df.iloc[:-3,:]

# 重置索引
pdf_df = pdf_df.reset_index(drop=True)

# 保存到 csv 文件中
pdf_df.to_csv("mt_2018.csv")

当然,今天就到这里,其它的需求我们下次给大家完善。大家也可以自己将代码封装成函数,这样就可以实现传入 pdf文件名称、页数以及保存的文件名来复用代码。如果大家再掌握了 pandas 就可以根据自己的需求,对各个表格数据进行处理。再结合 seaborn 绘图可视化,完爆 excel ~ 快学习起来叭,GOGOGO

以上就是Python读取pdf表格写入excel的方法的详细内容,更多关于Python读取pdf表格写入excel的资料请关注我们其它相关文章!

(0)

相关推荐

  • Python使用Excel将数据写入多个sheet

    将一个列表数据写入output.xlsx的a,b,c--等sheet中 import pandas as pd df1 = pd.DataFrame({'a':[3,1],'b':[4,3]}) df2 = df1.copy() with pd.ExcelWriter('F:\\python入门\\数据2\\output.xlsx') as writer: str1 = ['a','b','c','d','e','f','g','h','i',\ 'j','k','l','m','n','o',

  • PYTHON如何读取和写入EXCEL里面的数据

    好久没写了,今天来说说python读取excel的常见方法.首先需要用到xlrd模块,pip install xlrd 安装模块. 首先打开excel文件: xl = xlrd.open_workbook(r'D:\file\data.xlsx') 传文件路径 通过索引获取要操作的工作表 table = xl.sheets()[0] 有些人不知道啥是工作表,下图这个: 获取第一行的内容,索引从0开始 row = table.row_values(0) 获取第一列的整列的内容 col = tabl

  • Python 使用xlwt模块将多行多列数据循环写入excel文档的操作

    我就废话不多说了,大家还是直接看代码吧~ #!/usr/bin/python # -*- coding: utf-8 -*- import xlwt import re def host_regex(dataline): host_regex = r"<host>(.*?)</host>" host = re.findall(host_regex, dataline) if host: return host[0] def ip_regex(dataline):

  • python3.7 openpyxl 在excel单元格中写入数据实例

    本来我是想尝试,选中某个多个单元格复制到同一个sheet的其他位置,找了很多资料没有找到,目前只有这么一个办法,如果有大佬看到,欢迎补充请教. # encoding:utf-8 import pandas as pd import openpyxl xl = pd.read_excel(r"E:\55\CRM经营分析表-10001741-1570416265044.xls") xl.to_excel(r"E:\55\crms.xlsx") wk = openpyxl

  • python查询MySQL将数据写入Excel

    一.概述 现有一个用户表,需要将表数据写入到excel中. 环境说明 mysql版本:5.7 端口:3306 数据库:test 表名:users 表结构如下: CREATE TABLE `users` ( `id` bigint(20) NOT NULL AUTO_INCREMENT, `username` varchar(50) COLLATE utf8mb4_bin NOT NULL COMMENT '用户名', `password` varchar(255) CHARACTER SET u

  • python各种excel写入方式的速度对比

    经过实验,新建一个excel表格,该表格拥有7个sheet,每个sheet有800条数据,其中最后一个sheet为空. 首先使用openpyxl进行写入操作,代码如下: book = openpyxl.Workbook() auths = Auth.objects.filter(owner_id=1) filename = '导出数据' for auth in auths: sheet = book.create_sheet(auth.name, index = 0) sheet.append(

  • python 使用pdfminer3k 读取PDF文档的例子

    1.安装 pdfminer3k 通过pip安装: pip install pdfminer3k 下载安装:在网页 https://pypi.org/project/pdfminer3k/1.3.1/#files 进行下载,解压.然后cmd命令进入到当前文件夹: 可以直接在资源管理器的路径栏直接输入cmd进入到当前目录.然后执行 python setup.py install 等待安装完成 2.读取pdf中的TXT代码示例: from pdfminer.converter import PDFPa

  • Python解析并读取PDF文件内容的方法

    本文实例讲述了Python解析并读取PDF文件内容的方法.分享给大家供大家参考,具体如下: 一.问题描述 利用python,去读取pdf文本内容. 二.效果 三.运行环境 python2.7 四.需要安装的库 pip install pdfminer 五.实现源代码 代码1(win64) # coding=utf-8 import sys reload(sys) sys.setdefaultencoding('utf-8') import time time1=time.time() impor

  • Python2.7读取PDF文件的方法示例

    本文实例讲述了Python2.7读取PDF文件的方法.分享给大家供大家参考,具体如下: 这篇文章示例代码采用的Python版本是2.7,需要下载的插件是PDFMiner,下载地址是http://www.unixuser.org/~euske/python/pdfminer/,地址里有安装方法,我就不再细说了,需要说明的是Python2只能使用PDFMiner,Python3不能使用,Python3可以使用PDFMiner3K,下载地址为https://pypi.python.org/pypi/p

  • python实现PDF中表格转化为Excel的方法

    这几天想统计一下<中国人文社会科学期刊 AMI 综合评价报告(2018 年):A 刊评价报告>中的期刊,但是只找到了该报告的PDF版,对于表格的编辑不太方便,于是想到用Python将表格转成Excel格式. 看过别人写的博客,发现Python解析PDF有以下四种方式: -pdfminer:擅长文字的解析,把表格解析成普通的文本,没有格式: -pdf2html:把pdf解析成html,但html的标签并没有规律,解析一个表格还可以,多个表格的话不太好提取: -tabula:对于简单的表格,即单元

随机推荐