2. 按年份模糊匹配筛选、按险种分组汇总:
# 转换日期,筛选2025年数据
df["结算日期"] = pd.to_datetime(df["结算日期"])
df_2025 = df[df["结算日期"].dt.year==2025]
# 分组求和
group_data = df_2025.groupby("险种名称")["人次"].sum().reset_index()
3. 最后通过docxtpl载入Word模板,循环填充表格、自动计算合计、正负增长率,一秒生成完整正式报告,序号、格式、百分比全部自动排版,再也不用手动粘贴表格。
res = df[df["病种名称"].str.contains("高血压",na=False,case=False)]
不管是精确匹配、模糊包含、多关键词“或/且”筛选,一行代码搞定几万行数据。
场景3:SQL直达数据库,精准统计原始业务数据
Excel表格本质是“本地小数据库”,真正业务系统海量数据,用SQL查询远比导出表格再处理高效。
一句简单SQL就能完成分组、统计、计数:
数据库源头直接拿到干净统计结果,省去中间反复导出、复制的多余步骤。
场景4:系统无导出功能?Requests自动抓取网页数据
很多老旧业务系统、后台页面只支持查看、不能批量导出表格,手动复制效率极低。
用 requests 库模拟网页访问,直接把页面表格数据抓取下来转为DataFrame,后续一键清洗统计,彻底摆脱“手动抄数据”。

二、Pandas高频王牌方法,办公天天都在用
不用记复杂语法,这几个函数覆盖90%数据处理需求:
1. merge:两张表按编码/名称关联匹配(Excel的VLOOKUP高阶版,多列匹配不报错)
2. apply:自定义批量处理单元格(比如文字“增长/下降”转为正负号、金额转万元单位)
3. str.contains:模糊关键词匹配、字符筛选(病种、地址、编码检索神器)
4. groupby+agg:分组求和、计数、算同比,各类业务统计核心

三、最后总结:普通人学它到底有什么用?
不用成为专业程序员,职场人学这套组合,核心就3个价值:
1. 省时间:一下午手工报表 → 脚本运行10分钟出结果,告别无效加班;
2. 零出错:代码逻辑固定,不会出现复制粘贴手误、计算错误;
3. 可复用:脚本写一次,后续每月/每季只换原始数据,一键刷新报告。
从数据库SQL取数→Pandas清洗汇总计算→Requests补抓缺数→docxtpl自动输出Word成品报告,一条完整自动化链路,是现在数据岗、行政、办公人员的效率刚需技能。

小建议:先从CSV批量处理+Word自动报表入手练手,门槛最低,见效最快!
夜雨聆风