15个Excel文件,手动合并要40分钟,用Codex 10秒搞定。这不是段子,是我过去7个月接了40多单数据处理后验证出来的效率。
这篇是一个实操手册:6个真实场景的Codex Prompt,从批量合并、数据清洗、生成报表到拆分文件,全部可以直接复制使用。文末有踩坑清单和效率对比表,帮你跳过我已经踩过的坑。
我做了7个月AI接单,这类数据处理的单子占了将近一半。客户丢过来的需求五花八门,但核心操作就那几类。下面按场景拆解,每个都带完整Prompt,拿走直接用。
先说一个前提:Codex是OpenAI推出的编程代理工具,你用大白话描述需求,它帮你写代码并执行。不需要你会Python,但你需要知道怎么把需求说清楚。下面所有案例,核心都是"Prompt怎么写"。
场景1:批量合并多个Excel文件
做电商的客户每个月要整理20多家店铺的后台数据,丢过来的文件有CSV、xlsx、xls混着来的,文件名也乱七八糟——"2024年10月销售数据(1).xlsx"、"店铺A_10月_最终版.xlsx"、"店铺A_10月_最终最终版.xlsx"。
她的需求很简单:合并成一张表,按日期排序,金额列统一成数字格式。
Prompt 1:批量合并
我当前目录下有15个Excel文件(.xlsx格式),请帮我写一个Python脚本,实现以下功能:
1. 读取当前目录下所有.xlsx文件
2. 把所有文件的数据合并成一个DataFrame
3. 新增一列"来源文件",记录每行数据来自哪个文件
4. 按"日期"列升序排列
5. 把"金额"列统一转成浮点数格式(处理可能存在的字符串格式金额,比如带逗号的"1,234.56")
6. 输出合并后的文件为"合并结果.xlsx"
把代码复制到本地终端一跑,15个文件、20000多行数据,10秒合并完毕。手动操作至少40分钟。
注意Prompt第5点,我特意提到了"带逗号的金额字符串"。这种细节如果你不提,Codex可能不会主动处理,最后输出的文件里有几行数据格式不对,你还得返工。
❝踩坑提醒:文件编码问题。 合并CSV时经常碰到乱码,因为有的文件是UTF-8,有的GBK(特别是老系统导出的)。解决办法是在Prompt里加一句:"自动检测文件编码,兼容UTF-8和GBK"。Codex会在代码里用try-except自动处理,一劳永逸。
场景2:数据清洗——去重、格式统一、处理缺失值
客户做私域运营,手上有8个渠道导出的客户名单,格式五花八门:手机号有的带"86-"前缀,有的不带;姓名前后有空格;日期写法有"2024-01-15"、"2024/1/15"、"2024年01月15日"三种;还有些行完全是空的。
这种数据直接分析是不可能的,必须先清洗。写一个足够详细的清洗Prompt,比你自己一行一行检查快太多了。
Prompt 2:数据清洗
我有一个Excel文件"客户原始数据.xlsx",大约5000行,需要做以下清洗:
1. 去除完全重复的行(所有列都一样才算重复)
2. "手机号"列:去掉"86-"、"+86"等前缀,只保留11位数字,不足11位的标记为"异常"
3. "姓名"列:去除前后空格,去除中间的多余空格
4. "注册日期"列:统一格式为"YYYY-MM-DD",处理"2024/1/15"和"2024年01月15日"等不同写法
5. "邮箱"列:转为小写,检查是否包含"@",不包含的标记为"异常"
6. 对于缺失值(空单元格),数字类型填0,文本类型填"未知"
7. 输出一份清洗报告:去重了多少行、各列异常值数量、最终有效行数
8. 输出清洗后的文件为"客户数据_已清洗.xlsx"
跑完自动输出清洗报告:去重237行,手机号异常45条,邮箱异常89条,日期转换成功4832条,最终有效数据4763行。手动清洗这些数据,保守估计3小时。
这里有个关键技巧:Prompt第7点要求输出"清洗报告"。这一步非常重要,因为它让你能验证清洗结果是否合理。如果报告显示去重了4000行(总共5000行),你就知道清洗逻辑可能有问题,需要调整。不输出报告的话,你根本不知道中间发生了什么。
❝踩坑提醒1:隐藏字符。 有批数据怎么都对不上,查了半天发现单元格里有零宽空格(看不到但实际存在的字符)。在清洗Prompt里加一步"去除所有不可见字符",让Codex用正则处理,才能彻底干净。
踩坑提醒2:日期格式是个无底洞。 "2024.1.15"、"2024-01-15"、"2024/01/15"、"2024年1月15日"、"20240115"、"Jan 15, 2024"——中国人的日期写法太丰富了。建议在Prompt里把所有见过的格式都列出来,让Codex写一个全面的转换逻辑,别指望它能猜全。
场景3:自动生成月度报表——从原始数据到图表+分析
每月要统计各平台的播放量、涨粉数、收入。以前手动做透视表、画图、写分析,每次搞半天。这个场景的核心是:让Codex一步到位完成"数据汇总→图表生成→分析结论"的全链路,而不是拆成三步做。
Prompt 3:自动生成月度数据报表
我有一个Excel文件"2024年12月运营数据.xlsx",包含以下列:日期、平台(抖音/小红书/B站/视频号)、视频标题、播放量、点赞数、评论数、转发数、新增粉丝、收入(元)。
请帮我生成一份月度报表,要求:
1. 汇总统计:各平台的总播放量、总点赞、总评论、总粉丝增长、总收入
2. 环比数据:与上月(11月)对比,计算各指标的增长率
3. 生成3张图表(保存为图片):
- 各平台播放量对比柱状图
- 本月播放量TOP10视频条形图
- 本月每日全平台播放量趋势折线图
4. 写一段200字以内的分析结论,包括:本月表现最好的平台、增长最快的指标、需要关注的问题
5. 所有内容整合到一个新的Excel文件"12月运营月报.xlsx"中,分sheet存放数据和图表
出来的效果:4个sheet——"汇总概览"、"各平台明细"、"TOP10视频"、"每日趋势"。图表自动嵌在对应sheet里,下面还附了分析文字。从丢数据到出报告,不到5分钟。以前手动做要2小时。关键是图表风格统一、数据准确,不会因为手抖把数字打错。
这个Prompt有个值得注意的地方:第2点要求算环比增长率。这意味着你需要有11月的数据,在Prompt里要明确说清楚"上月数据在哪个文件"或者"同文件中包含11月和12月两个月的数据"。含糊不清的话Codex会自己猜,猜错了你白忙活。
场景4:批量提取/汇总多个表格的关键数据
财务朋友每个月要从30多个子公司的报表里提取关键数字,汇总到一张总表。每个子公司的报表格式不完全一样,但关键指标的名字差不多。
这类需求的关键难点是:字段名不统一。有的写"营收",有的写"营业收入",有的干脆写英文"revenue"。Prompt里必须明确要求模糊匹配。
Prompt 4:批量提取汇总
我有一个文件夹,里面有30多个Excel文件,每个文件代表一个子公司的月度财务数据。
请帮我:
1. 从每个文件中提取以下字段(字段名可能略有不同,需要模糊匹配):
- 营业收入(可能的字段名:营业收入、收入、营收、revenue)
- 净利润(可能的字段名:净利润、利润、net_profit)
- 员工人数(可能的字段名:员工人数、人数、headcount)
- 月份(可能在文件名中,如"XX公司_2024年10月.xlsx")
2. 如果某个字段找不到,标记为"未找到"
3. 汇总成一张表,列:公司名称、月份、营业收入、净利润、员工人数
4. 额外生成一个汇总sheet:各指标的总和、平均值、最大值、最小值
5. 输出"财务汇总_2024年10月.xlsx"
关键是"模糊匹配"——实际业务中字段名不可能统一,不模糊匹配根本抓不全。第2点"找不到标记为未找到"也很重要,它避免了Codex因为某个字段缺失而直接报错中断。
朋友拿到结果说了句:"这东西早两年给我,我能少加多少班。"
场景5:按条件拆分一个Excel成多个文件
培训机构有个3000多人的学员总表,要按班级拆分成单独文件,每个班一个,文件名用班级名命名。
这种拆分操作手动做极其枯燥,而且容易漏班、漏人。让Codex来做,20秒搞定,还自动生成目录汇总。
Prompt 5:按条件拆分文件
我有一个Excel文件"学员总表.xlsx",共3500行数据。
请帮我按"班级名称"列拆分,每个班级生成一个单独的Excel文件。要求:
1. 文件名格式:"{班级名称}_学员名单.xlsx"
2. 每个文件保留表头
3. 在每个文件的第一行插入一行信息:班级名称、学员人数、班主任姓名(从原表"班主任"列取)
4. 自动创建一个目录文件"班级汇总.xlsx",列出每个班级的文件名、学员人数、班主任
5. 所有文件保存到当前目录下的"拆分结果"文件夹中
自动生成了48个文件,外加一个汇总目录,整个过程20秒。手动拆分要筛选、复制、新建文件、粘贴、命名,48个班保守估计2小时,还容易漏。
❝踩坑提醒:大文件内存溢出。 处理50万行的Excel时,Python直接报内存不足。解决办法是让Codex改成分块读取(chunksize),每次读5万行,处理完再读下一批。遇到大文件时一定要在Prompt里提一句"使用分块读取方式处理,避免内存溢出"。
进阶:把跑通的流程沉淀成脚本模板
用了几个月我发现一个规律:很多需求是重复的。客户A要合并Excel,客户B也要合并,区别只是列名和格式不同。每次从零开始让Codex写代码,其实有点浪费。
更高效的做法是:每次Codex生成代码后,把它保存成.py文件,放在固定文件夹里,旁边写一个简短说明。目录结构大概这样:
/Excel处理脚本库/
├── 合并Excel/
│ ├── merge_excel.py
│ └── 说明.txt
├── 数据清洗/
│ ├── clean_data.py
│ └── 说明.txt
├── 生成报表/
│ ├── gen_report.py
│ └── 说明.txt
└── 拆分文件/
├── split_excel.py
└── 说明.txt
下次遇到类似需求,直接把旧脚本丢给Codex,告诉它哪里要改:
Prompt 6:基于已有脚本快速适配新需求
我有一个之前写好的Python脚本(内容如下),用于合并Excel文件。
现在的需求有些变化:
1. 需要合并的文件从xlsx改成了csv格式
2. 合并后需要按"商品类目"列做分组汇总
3. 输出格式改为csv
请基于我原来的脚本逻辑,修改适配新需求。
[粘贴原脚本内容]
Codex理解你的原始代码后,修改起来又快又准。这种方式比每次从零写一个新Prompt效率高得多,因为Codex能复用已验证的逻辑,只改动需要变的部分。
我现在积累了二十多个脚本模板,覆盖了90%的客户数据需求。新需求来了,80%的情况下5分钟内搞定。
效率对比:直接上数字
以前接一个数据处理的需求要预留半天时间。现在10分钟搞定。
这7个月数据处理类的单子接了40多单,平均每单收费800-2000块。按以前的效率,能接一半就不错了。现在客户上午发需求,下午就能交付,剩余时间该干嘛干嘛。
写好Prompt的几个原则
几个月的实战下来,总结了一些写数据处理Prompt的原则,分享出来:
列名要写死:别用"某一列"这种说法,直接写清楚"手机号"列、"注册日期"列。Codex不知道你Excel长什么样。 异常处理要显式要求:如果你不要求,Codex生成的代码默认不会处理异常值。遇到可能脏的列,一定要加一句"异常情况标记为XX"。 输出文件要命名:不指定的话Codex会自己取名字,可能叫"output.xlsx"或者"result.xlsx",多了你就分不清了。 分步骤写:把需求拆成1、2、3、4,不要写一大段话。分步骤写的Prompt,Codex理解起来更准确,生成的代码也更健壮。
核心方法论:你不需要会Python
用Codex处理Excel,你要做的就两件事:
准确描述需求——把"我要什么"用大白话说清楚,越具体越好。字段名、格式要求、输出文件名,一个都别含糊。 检查结果——跑完以后打开文件看看对不对,有问题再追加Prompt让Codex改。
就这两步。一个隐藏的好处是:你描述需求的过程,本身就是在梳理业务逻辑。以前稀里糊涂地复制粘贴,现在必须想清楚"我到底要什么",这个思考过程反而让产出质量更高了。
如果你每天都在和Excel打交道,建议现在就打开Codex,把手头正在做的那个操作描述一遍,让它帮你写。第一次可能需要调试几次,但一旦跑通了,你就回不去了。
手动复制粘贴Excel的感觉,就像在洗衣机旁边用手搓衣服——没必要。
夜雨聆风