
VOL.5207
为深入学习贯彻习近平新时代中国特色社会主义思想,进一步用好社会大课堂,教育引导当代大学生在社会实践中坚定理想信念、矢志拼搏奋斗,以打头阵、当尖兵的奋斗姿态,锻造成长为中国式现代化建设的行动派、实干家。复旦大学哲学学院暑期学生社会实践工作以「逐梦强国建设,勇当青春先锋」为主题,组织13条实践线路,前往湖南、四川、上海等地开展调研,鼓励学生将课堂所学知识投入具体实践当中,紧密结合学科特色和专业所长,形成具有建设性意见的调研报告、解决方案或学术文章,上好扎根中国大地的“大思政课”。
各条实践路线已经陆续启动,本栏目将第一时间带领大家直击实践现场,展现复旦哲院学子行走祖国大地的收获与感悟。本期我们走进的是“AI时代的商业数据洞察:从“使用工具”到“产出结果”的第二日课程。
2026年7月2日,“AI时代的商业数据洞察”活动进入第二天,李佳美老师的教学延续案例驱动、注重实战的风格,上午聚焦数据清理(Data Cleaning),下午聚焦探索性数据分析(EDA),以“灯塔咖啡”的数据为素材,带大家走完了从原始脏数据到干净数据、再到可辩护洞察的完整流程。
Session 3 数据清理:不再是数据工程师的专利
课上老师指出,在AI的协助下,数据清理不再只是数据工程师的技术工作,但完全依赖AI并不可行,仍需分步进行并保留人工判断与验证。若清理者缺乏对分析目标的理解,容易出现清理规则与业务需求脱节的情况。她提出,数据清理服务于分析目标,分析目标服务于北极星指标,应先定指标,再定清理规则,以避免无效工作。
实战环节,老师用“灯塔咖啡”未清洗的脏数据(重复行、日期格式混乱、标签不统一、负值退款、非法日期等)演示了三类AI工具的表现:以DeepSeek为代表的Chatbot能识别问题并给出清理代码,但无法直接输出清理后的文件,非技术人员难以验证;以豆包为代表的Agent工具能自动生成清理后的Excel文件和清理摘要,但会自作主张,例如直接将负值退款取绝对值;以Cursor为代表的代码辅助工具支持本地文件读写、能生成修改日志,但同样会基于隐含假设做出较大改动,例如按Order ID顺序推断非法日期,一旦假设不成立,后果较重。
老师据此讲授了一套人工在环的分步清理流程:AI识别问题,人工判断哪些问题影响分析目标;AI给出处理建议,人工逐条确认或修改,尤其警惕“取均值”“填充空值”等自动化操作;AI按确认规则执行清理并生成日志,人工核对修改和删除行数是否符合业务常识;AI输出清理后数据及风险提示,人工抽样验证关键指标是否合理,若异常则回到上一步。老师提醒,即便AI说明了删除记录的理由,也应回翻原始表格抽检核实,原始数据才是唯一的裁判。
四个小组随后分别汇报了清理实战情况。第一组认为最危险的三个问题是日期格式、重复数据泛滥和命名不统一,以Claude Code为主要工具,通过PowerShell读取Excel、编写Python脚本并调用Pandas完成清洗;AI较好完成了渠道和品类标准化及重复订单去重,但对“days since last order”字段负值的处理是否合理仍待讨论。第二组判断的高危问题是30天复购标记错误率偏高、日期格式混乱和字段命名不统一,选用豆包处理数据,认为其在分类处理和批量处理上效率较高;AI完成了核心指标校正和格式统一,但对缺失的会员等级和促销信息,组员建议标记保留而非直接清除。第三组关注日期格式歧义、身份标识缺失和时间逻辑负数,认可AI处理ID缺失的方式,但不认可其对日期起始格式和时间逻辑的处理,认为推导方式不可靠,建议可修复的交由AI处理,逻辑不通的标记后人工审核。第四组识别出完全重复行、被赋值的购买间隔和消费金额异常,使用豆包和Chat交叉验证,删除了完全重复、无客户ID和无效日期的数据;对比发现豆包处理负值时间间隔更为有效,消费金额异常数据则选择保留,建议人工核对。
互评环节中,同学们围绕“日期格式混乱是否只是表面问题”展开讨论:有人认为AI能轻松统一格式,也有人反驳称若日期本身错误,格式统一没有意义,须追溯业务系统日志才能解决。老师总结,数据清理离不开人工判断,是好的业务分析的基础,不能完全依赖AI。
Session 4EDA:不急于最终解答,先探索分析方向

下午活动进入探索性数据分析(EDA)。老师指出,EDA的核心任务不是给出结论,而是帮助分析者理解数据、发现值得关注的差异,并明确下一步方向,它指向下一步而非终点。她也纠正了一个常见误解:EDA不等于制作漂亮的仪表板或图表,图表只是表现形式,真正的任务是识别模式、发现异常、形成假设。
老师分享了自身经历:2018年前后企业开始组建数据分析团队时,EDA高度依赖专业技术人才,她所在团队曾因海外总部人员技能不同而被迫更换工具,成本和效率都受影响;传统EDA中一张图表的调整常需数天甚至数周,而在AI时代只需用自然语言描述需求,AI便可在数秒内生成图表、构建交互页面并推荐分析维度。但效率提升不代表工作变简单,反而要求分析者投入更多精力用于判断、提问和验证,数据分析师的角色也从写代码的人转变为提问题的人和判断答案的人。
实战演示中,老师让豆包基于“灯塔咖啡”客户首单数据集生成交互式HTML分析页面,数据包含30天内是否复购、复购转化周期、渠道、品类、消费金额、门店、天气、促销等字段。AI输出了趋势图、维度对比图和数据摘要,但老师引导大家发现其中问题:某日复购率达到100%不符合常识,需进一步核查;AI自动选取的对比维度看似完整,却未直接回答什么因素影响最大;AI呈现的分析看似合理,实质只是描述数据,并未解释因果。
老师据此给出EDA三步法:先看趋势图,判断复购率变化是否存在季节性、促销或系统异常波动;再做维度对比,对会员类型、渠道、品类、时段、促销等因素分组比较,找出差异最大的维度;最后做交叉分析,聚焦最突出的维度进行多因素探索,逼近因果关系。每一步完成后都需停下判断,不宜让AI一次性跑完。
在图表设计上,老师提出好的图表应在十秒内被看懂、无需口头解释、只回答一个问题,并以一张信息过载的反面案例说明,图表越简单,信息传递效率越高。折线图适合展示趋势,柱状图适合分类对比,饼图适合展示构成比例,散点图适合展示相关性,选择图表前应先明确想回答的问题,一张图只承载一个问题。
下午作业要求各组基于清洗后的首单数据集完成EDA,汇报趋势图分析、至少三个维度的对比分析、一次交叉分析尝试、AI分析中的可疑之处及下一步方向,不要求给出最终结论,但需展示完整的探索过程。老师提供了分步提示词模板,要求先出趋势图并判断,再出维度对比图并判断,再做交叉分析并判断,最后才整合为HTML页面,强调不能让AI一次性完成全部EDA。讨论中,有同学发现某天复购率异常偏高,提出应追问是否有促销活动或数据录入问题;有同学指出AI推荐的对比维度遗漏了产品品类和促销;也有同学提醒,图表只能说明相关性,不能证明因果,真正的因果关系需要更严谨的验证。

结语
一天的活动让大家形成了三点认知:脏数据不只是麻烦,更是陷阱,可能让分析工作全盘推翻、让决策者失去对数据团队的信任,AI是高效的清道夫,但不是合格的质检员,其规则假设需要人类用业务语境去校验,应始终信任但验证;EDA不提供最终答案,但为答案指明方向,AI可以加速这一过程,但分析者须清楚自己想知道什么,否则会被带偏;应始终区分相关性与因果性,相关性是线索,因果性需要更多证据支撑。老师在课程结束时表示,清理后的数据若不能确信不会误导分析,说明清理流程尚未完成,数据的清洁度就是分析师的信用度。

撰稿 | 刘羽轩 晋谊 潘弘毅 徐琬云
编辑|张羽宁
审核 | 屠淳昱
责任编辑丨汤克凤 隋艺菲

夜雨聆风