夜雨聆风学习资料网

ARTICLE · 1055194

Python Pandas:程序员版 Excel,两行代码干一天的活

Python Pandas:程序员版 Excel,两行代码干一天的活

同事用 Excel 处理 10 万行数据:筛选卡顿、筛选卡顿、筛选卡顿、然后 Excel 崩了,一下午白干。

你用 Pandas:两行代码,3 秒出结果,还能把处理过程存成脚本,下个月同样的事一键重跑。这就是数据处理自动化的差距。AI 训练前喂的数据清洗,一半也是它干的。

Pandas 的核心叫 DataFrame——一张会自己思考的 Excel 表。你会筛选、会汇总、会排序,它就听你的。

一、三秒入门:读表、看表

import pandas as pd         # 全世界都这么缩写df = pd.read_csv("sales.csv"# 读表,一行print(df.head())      # 看前5行print(df.info())      # 有哪些列、有无缺失

拿到任何新数据,固定起手式就是 head() + info():先看长什么样,再查有没有缺。Excel 要点开滚动条干的事,两行命令完事。

二、灵魂三招:筛、选、算

# 假设表有列:城市, 销售额, 销售df[df["销售额"] > 10000]        # 筛:销售额过万df["提成"] = df["销售额"] * 0.05# 选:加新列df["销售额"].sum()                # 算:总销售额

注意第一行的写法:方括号里塞了个条件——是不是有点眼熟?就是第 6 篇学的 if 条件,直接搬进方括号当"筛子"。加新列像给字典加键一样自然。三招组合起来,日常报表需求能覆盖八成。

三、大杀器:groupby 分组统计

# 每个城市的总销售额、平均单额result = df.groupby("城市")["销售额"].agg(["sum""mean"])print(result.sort_values("sum", ascending=False))

groupby 的意思是"按城市分堆,每堆分别算"。Excel 里的数据透视表,就是这行代码的鼠标版。再接一个排序,"各城市销售额排行榜"直接出炉——同事做透视表的时间里,你已经在喝茶了。

四、AI 里的 Pandas:喂数据前先洗澡

# AI训练前的常规清洗df = df.dropna()                          # 删缺失行df = df.drop_duplicates()                 # 去重df["分数"] = (df["分数"] - df["分数"].mean()) / df["分数"].std()  # 标准化

"垃圾进,垃圾出"是 AI 铁律:数据不干净,模型再好也白搭。去缺失、去重复、标准化——这三行就是数据清洗的最小套装。以后不管学机器学习还是做大模型应用,Pandas 都是你的洗手池。

五、三条实操建议

1

先 head 后动手。任何数据处理前先看数据长什么样,能省掉一半冤枉路。

2

链式操作别一步到位。复杂处理拆成多行,每行 print 检查,比一行长链好调试十倍。

3

处理完就存档。df.to_csv("结果.csv", index=False)——别让辛苦白跑一场。

Excel 是手工时代的数据工具,Pandas 是自动化时代的。同一份数据,你快,还不累。

下篇预告:Matplotlib——数据不画出来,老板看不见。

—— 七七不吃糖

相关学习资料