Pandas案例精进 | 续集:自动分割汇总表写入到子表

大家好!

欢迎来到「Pandas案例精进」专栏,点击橙字查看全部

前文回顾:Pandas案例精进 | 自动分割汇总表写入到子表中

本文是承接上一篇的实战案例,没看过的小伙伴建议先点击👆上方链接查看前文

Pandas案例需求

现在的新需求跟之前的区别有:

汇总表多了级别字段,需要根据不同的级别对应不同的文件夹:

所属区的xlsx文件有时可能是xls,并不一定是xlsx的。

各级别文件夹中存在一些不能匹配汇总表的垃圾文件需要删除。

汇总表中所有的对应项目并不是都在级别文件夹中存在,不存在的只提示哪些不存在,无需额外处理。

下面是我的实现过程:

数据加载

1import os 2import pandas as pd 3 4excel_dir = os.getcwd() 5 6data = pd.read_excel(f"{excel_dir}/汇总.xlsx", sheet_name='明细') 7data 8

本文直接设置excel_dir为工作目录,大家如果代码和数据不在同一文件夹,可以根据自己的情况更改设置文件路径。

遍历计算出每级别所涉及的区

1level_areas = {} 2for i, row in data.iterrows(): 3    areas = level_areas.setdefault(row['级别'], set()) 4    areas.add(row['所属区']) 5level_areas 6

执行结果

1{'一级': {'B区'}, '二级': {'A区', 'C区'}, '三级': {'D区', 'E区'}} 2

删除多余文件+转换xls

这里会用到win32com.client库,需要额外安装。

1pip install pywin32 2

也可使用国内清华源来加快Python库的安装速度。

1pip install pywin32 -i https://pypi.tuna.tsinghua.edu.cn/simple 2

安装后使用

1import win32com.client as win32 2 3for level in data['级别'].unique(): 4    areas = level_areas[level] 5    files = os.listdir(f"{excel_dir}/{level}") 6    for file in files: 7        tag = file.replace(".xlsx", "").replace(".xls", "") 8        filename = f"{excel_dir}/{level}/{file}" 9        if not tag in areas: 10            print(f"删除文件:{filename}") 11            os.remove(filename) 12        elif file.endswith(".xls"): 13            print(f"将 {filename} 转换为 {filename}x") 14            excel = win32.gencache.EnsureDispatch('Excel.Application') 15            try: 16                wb = excel.Workbooks.Open(filename) 17                wb.SaveAs(f"{filename}x", FileFormat=51)  #FileFormat = 51 is for .xlsx extension 18                print("转换成功") 19            finally: 20                wb.Close()  #FileFormat = 56 is for .xls extension 21            excel.Application.Quit() 22            os.remove(filename) 23

上述代码可以实现删除级别文件夹多余的文件并将xls转换为xlsx。

比如将 一级/B区.xls 转换为 一级/B区.xlsx

注意:使用pywin32转换excel文件格式时,绝对路径的盘符后面的分隔符必须是反斜杠\,后面的路径分隔符用正斜杠或反斜杠都可以。

遍历出级别和区域

1for (level, area), df in data.groupby(['级别', '所属区']): 2    print(level, area) 3    df = df.iloc[:, 2:] 4    display(df) 5

执行结果

写出结果

最后,利用openpyxl库将结果分别写入各级别、各Excel文件中。

1from openpyxl import load_workbook 2 3for (level, area), df in data.groupby(['级别', '所属区']): 4    print(level, area) 5    df = df.iloc[:, 2:] 6    out_file_name = f"{excel_dir}/{level}/{area}.xlsx" 7    if not os.path.exists(out_file_name): 8        print(out_file_name, "文件不存在,跳过") 9        continue 10    print("准备写出到:", out_file_name) 11    workbook = load_workbook(filename=out_file_name) 12    sheet = workbook.active 13    # 先删除第4行之后的旧数据,预计1000行完全够用 14    sheet.delete_rows(idx=4, amount=1000) 15    # 然后再进行添加数据 16    for row in df.values.tolist(): 17        sheet.append(row) 18        print(row) 19    print(f"保存到{out_file_name}文件中") 20    workbook.save(filename=out_file_name) 21    workbook.close() 22

小结

估计有朋友觉得本文为了处理几个Excel写了这么多行代码,也没看出来有啥效果。

但是上面只是示例数据,而群友真正工作要处理的数据有几百个文件夹,用代码处理的优势一下子就体现出来了。

不如看看反馈吧:

如果大家喜欢我们的文章,就给右下角点个赞👍吧~

本文代码和案例数据

如果大家想自己练手,可以通过以下步骤获取代码及案例数据👇

最后,还有「凹凸数据」的荐书环节!

本文转转自微信公众号凹凸数据原创https://mp.weixin.qq.com/s/WxWOt6SRJnXDbvX7Lz_rCA,可扫描二维码进行关注: 如有侵权,请联系删除。

点赞
收藏

评论区

加载中...

相关推荐

MySQL:[Err] 1292 - Incorrect datetime value: ‘0000-00-00 00:00:00‘ for column ‘CREATE_TIME‘ at row 1

文章目录问题用navicat导入数据时,报错:原因这是因为当前的MySQL不支持datetime为0的情况。解决修改sql\mode:sql\mode:SQLMode定义了MySQL应支持的SQL语法、数据校验等,这样可以更容易地在不同的环境中使用MySQL。全局s

Oracle 分组与拼接字符串同时使用

SELECTT.,ROWNUMIDFROM(SELECTT.EMPLID,T.NAME,T.BU,T.REALDEPART,T.FORMATDATE,SUM(T.S0)S0,MAX(UPDATETIME)CREATETIME,LISTAGG(TOCHAR(

MySQL部分从库上面因为大量的临时表tmp_table造成慢查询

背景描述Time:20190124T00:08:14.70572408:00User@Host:@Id:Schema:sentrymetaLast_errno:0Killed:0Query_time:0.315758Lock_

皕杰报表之UUID

​在我们用皕杰报表工具设计填报报表时,如何在新增行里自动增加id呢?能新增整数排序id吗?目前可以在新增行里自动增加id,但只能用uuid函数增加UUID编码,不能新增整数排序id。uuid函数说明:获取一个UUID,可以在填报表中用来创建数据ID语法:uuid()或uuid(sep)参数说明:sep布尔值,生成的uuid中是否包含分隔符'',缺省为

Pandas案例精进 | 结构化数据非等值范围查找 ②

(https://imghelloworld.osscnbeijing.aliyuncs.com/4971fbce1ecb759123ecc666f3af2c31.png)大家好,我是小五🐶欢迎来到「Pandas案例精进」专栏(https://mp.weixin.qq.com/mp/appmsgalbum?__bizMzU5Nzg

Pandas案例精进 | 结构化数据非等值范围查找 ①

(https://imghelloworld.osscnbeijing.aliyuncs.com/dac5483b3517ff8a0968fc75987d12ad.png)大家好,我是小五🐶欢迎来到「Pandas案例精进(https://mp.weixin.qq.com/mp/appmsgalbum?__bizMzU5Nzg5