AI 帮你洗脏数据:5 万行 Excel 1 分钟干净出库
上篇咱们讲"把 30 张分表 3 秒合成总表",这次聊它的姊妹篇——合完之后,怎么把脏数据洗干净。
你肯定遇到过这种表——
- ▸
同一客户,名字一会儿"张三"一会儿"张三 ",后面多个空格; - ▸
几千行里混着空行、重复行; - ▸
销售额列里夹着"暂无""—"这种没法算的东西; - ▸
日期格式乱七八糟,2026/1/1、2026-01-01、1月1日全都在。
传统做法:打开筛选、手动删、写一堆 VLOOKUP/IFERROR,1 万行能折腾一下午,5 万行基本要请人帮忙。
今天说个狠的:用 AI 一句话把脏数据洗成能直接出报告的干净表,全程不用写公式。
一、为什么"洗数据"比"合数据"更费命
合并表格,本质是同构拼接,规则清晰,AI 一眼懂。
但清洗是另一回事——它面对的是"人类犯的错":空格、错别字、缺失、格式不统一、异常值。这些没有标准答案,得靠你告诉 AI"什么算脏、怎么洗"。
好消息是:你不用会代码,只要会说人话。
二、三种洗法,从零门槛到可控
方案 1:WorkBuddy 自然语言
直接在对话框下指令,比如:
读取桌面"销售数据.xlsx",完成: 1. 删除完全重复的行; 2. 删除"客户名"或"销售额"为空的行; 3. 把"客户名"前后的空格去掉,全角转半角; 4. 把销售额里的"暂无""—"标记为空,不参与统计; 5. 按月份和区域汇总销售额,生成一张柱状图; 6. 输出新文件到桌面"销售数据_清洗后.xlsx"。
AI 会在本地沙盒里读结构、筛选、统计、出图,全程不写一行公式,数据也不离开你电脑。
方案 2:ChatExcel / 类似网页工具
把 Excel 上传到网页,用中文对话指挥它:"把这一列里的异常值标红""按地区分组求平均"。适合临时、非敏感的数据快速处理。
缺点:数据要传到对方服务器,敏感表慎用。
方案 3:Python + pandas
如果你愿意存一段模板(咱们上篇"合并 Excel"用的就是它),清洗也能复用:
代码
import pandas as pddf = pd.read_excel("销售数据.xlsx")# 1. 去重df = df.drop_duplicates()# 2. 删关键字段为空df = df.dropna(subset=["客户名", "销售额"])# 3. 清洗文本:去空格、全角转半角df["客户名"] = df["客户名"].str.strip()# 4. 异常值置空df.loc[df["销售额"].isin(["暂无", "—"]), "销售额"] = pd.NAdf["销售额"] = pd.to_numeric(df["销售额"], errors="coerce")# 5. 按月份+区域汇总df["月份"] = pd.to_datetime(df["日期"]).dt.to_period("M").astype(str)summary = df.groupby(["月份", "区域"])["销售额"].sum().reset_index()summary.to_excel("销售数据_清洗后.xlsx", index=False)
这段代码存一次,以后换文件名就能重复跑——这就是"洗数据"从体力活变成后台任务的分界点。
三、让 AI 洗得准的三个提示词心法
很多人说"AI 洗数据洗错了",多半是指令太模糊。三个动作立竿见影:
- ▸明确"什么算脏"
:别只说"清理一下",要说"删完全重复行 + 客户名为空的行"。 - ▸给异常值下定义
:"销售额里的'暂无''—'当缺失处理",AI 才知道怎么动。 - ▸指定输出形态
:"输出新文件,不要覆盖原表"——防止一键把原数据搞没,这是底线。
四、一个真实感的小例子
假设你手上有 5 万行 2026 年上半年销售记录,混着上述所有毛病。
按方案 1 下完指令,1 分钟左右你会拿到:
- ▸
一份去重、去空、文本归一的干净表; - ▸
一张按月×区域的销售额柱状图; - ▸
原文件原封不动,新文件单独存。
原来一下午的活,现在去泡杯茶的功夫就回来了。省下的不是时间,是"对着 Excel 烦躁"的情绪成本。
五、小结:今天就能做的一件事
找出你电脑里那张一直想整理又懒得动的表,用上面任意一种方式,下一条清洗指令试试。
哪怕只删掉重复行和空行,你也已经迈过了"脏数据只能手动收拾"的那道坎。
剩下的,交给它。
智懒实验室 · 让智能工具帮你偷懒。下篇想看我们把"清洗→分析→出报告"串成一条全自动流水线,评论区扣 1。
智懒实验室 · 每天用 AI 帮你少干点活关注我,把重复劳动交给工具 🐂
夜雨聆风