上一期,我让 WorkBuddy 整理了一个乱七八糟的文件夹。
这次,我想把难度再往上提一档:
如果交给它一份 36,748 行的复杂 Excel,它能不能像一名真正的数据分析师一样,发现问题、计算指标、生成图表,并且告诉我哪些结论可信?
我原本以为,这一期的重点会是“它能不能算对”。真正测完以后,我发现更重要的问题是:
AI 不但会帮你算数,还会悄悄替你决定“什么数据应该算进去”。
而这,才是普通上班族使用 AI 分析表格时最需要警惕的地方。
我给了它一张什么表?
这次使用的是 UCI Machine Learning Repository 的公开零售交易数据。我截取了 2011 年 3 月的数据,整理成一份 Excel:
| 36,748 行 | 8 个字段 |
| 3 张表 | 隐藏标准答案 |
数据里故意保留了缺失值、重复行、取消订单、负数量和零价格。我先人工计算了一份“标准答案”,但没有交给 WorkBuddy。

WorkBuddy实际读取的原始Excel,包含36,748行交易记录
这就是 WorkBuddy 实际读取的原始表格。滚动条几乎看不到尽头,仅靠人工逐行检查显然不现实。
6分36秒后,它交出了一份完整报告
WorkBuddy 没有只给我几句泛泛的总结。它读取工作表、建立 Python 分析环境,完成数据检查、指标计算和多维分析,最后交付一份 400 多行的 Markdown 报告和 6 张图表。
整个过程耗时 6 分 36 秒。对于不会写代码、也不熟悉数据透视表的普通上班族来说,这个效率确实很有冲击力。
报告附录还列出了它使用的工具与计算方法:Python、pandas、openpyxl 和 matplotlib,并明确说明原始文件以只读方式打开。这个细节很重要——我们不只能看到结果,还能追溯它是怎样得到结果的。

报告附录:工具环境、计算口径与产出文件
它没有急着给答案,而是先处理“数据能不能用”
报告开头先确认了工作表、字段和数据范围,然后把问题集中成一张质量清单。这里能看出它的分析顺序是对的:先确认原料,再讨论结论。

报告先给出分析总览,并汇总最值得关注的数据质量问题
随后,它没有直接删除异常记录,而是给出清洗建议:重复行建议去重;取消订单保留为负数冲减;Customer ID 缺失不填补;运费、折扣等非商品代码单独标记。
这比一句“数据已清洗”更可靠,因为每项动作都有理由和影响行数,用户可以在真正改表前决定是否接受。

清洗建议没有直接改写原表,而是逐项说明规则和影响范围
第一轮核对:基础数字几乎全部正确
我用原始 Excel 重新独立计算,逐项对照:
从报告中的质量检查表也能看到,它没有只报一个“数据质量良好”的笼统结论,而是把发现数、占比、严重程度和解释放在一起。

质量检查表:问题数量、占比和业务含义同时呈现
这一部分,WorkBuddy 的表现很稳。它还注意到 134 行“负数量、非取消订单、零价格”的特殊记录,并把原因放进了待确认清单,而不是冒充成已经证实的事实。
但接下来,出现了两套都能说得通的销售额
我的人工基线采用“非取消订单、数量大于 0、价格大于 0”的口径,毛销售额是 £717,639.36。
WorkBuddy 却给出了 £691,140.92。继续查看它的脚本和报告后,我发现它在计算前排除了 260 行 POST、D、M、S 等“非商品代码”。
| £691,140.92 | -£10,675.30 |
| £680,465.62 | £352.21 |
这些数字,我按它的规则重新计算后也全部对上了。所以,这不是一道简单的“谁算错了”的题。取消订单的图表留到后文结合业务含义再看,这里先追溯数字背后的口径。
下面这张指标表最值得看的是中间两列:它没有只展示结果,还写出了公式、计算口径和过滤条件。正是这些内容,让我们发现两套销售额差异来自规则,而不是加法错误。

核心指标表:结果旁边保留公式、口径和过滤条件
两套数字都可以计算正确,但它们回答的不是同一个问题。
真正危险的,不是算错,而是口径没有被看见
“本月销售额、客单价、退款率、表现最好的产品”看起来只需要一个数字,实际上都藏着定义:运费算不算销售额?折扣如何处理?取消订单是删除还是冲减?零价格记录要不要保留?
AI 可以在几分钟内帮你完成几十万次计算。但如果它替你选错了口径,报告越漂亮,反而越容易让人放松警惕。
它生成的6张图,到底分别在讲什么?
“生成了图表”并不等于完成分析。真正重要的是:每张图帮助我们看见了什么,又有哪些结论不能从图里直接推出?
值得肯定的是,WorkBuddy 在“关键发现”里主动把内容分成数据事实、合理推测和行动建议。例如,3 月 29 日销售额异常升高是事实;“可能由少数大额订单推动”属于根据客单价做出的推测,需要继续查订单明细。

关键发现不是一句判断,而是同时给出证据与推断边界
第一张:每日净销售额趋势
3 月 29 日出现明显峰值,当天净销售额达到 £68,938,是日均值的 2.73 倍。

第二张:各星期销售额和订单数
星期二、星期四销售额较高,星期三、星期四订单更多;四个周六全部没有交易记录。

图只能证明“周六没有数据”,不能证明“周六没有营业”,也可能是系统没有上传或数据范围造成的。
第三张:国家和地区销售额
英国净销售额为 £563,035,占有效商品净销售额约 82.74%,说明这份数据高度依赖英国市场。

第四张:销售额最高的10个商品
REGENCY CAKESTAND 3 TIER 排名第一,销售额为 £18,372。但没有成本数据,不能把“销售额最高”写成“利润最高”。

第五张:取消订单分析
取消订单率是 14.54%,金额影响却只有 1.54%,说明取消订单平均金额偏小。

第六张:数据质量问题汇总
8,926 行缺少 Customer ID,占 24.29%,是本次分析最大的完整性问题。

这 6 张图已经能支持一次初步汇报:先说明数据质量,再展示整体趋势、时间结构、国家结构、商品贡献和取消影响。但图表依然不能代替业务解释。WorkBuddy 将周六无数据、库存调整和客户编号缺失列入人工确认清单,而不是编造原因,这一点值得肯定。
报告最后专门列出分析边界:只有一个月数据、无法配对全部取消订单、没有库存和成本数据,也没有外部营销信息。这些限制决定了哪些话可以说,哪些话不能说。

分析边界与待确认问题:把不能从数据回答的部分明确留给人
普通上班族怎么安全使用AI分析Excel?
1. 这个数字的公式是什么?不要只要结果,要它写出计算公式。
2. 过滤掉了哪些数据?排除了多少行、什么类型、依据是什么?
3. 核心名词怎么定义?“有效订单”“销售额”“客户数”都必须有明确口径。
4. 能不能和原表总额对账?如果过滤前后数字不同,差额去了哪里?
5. 这是事实、推测,还是建议?三者必须分开写。
6. 哪些地方必须人工确认?业务规则不能因为 AI 算得快,就默认交给 AI 决定。
我的真实结论
WorkBuddy 可以读复杂 Excel、做数据质检、写分析脚本、计算指标、生成图表,再整理成一份结构完整的报告。它确实能把原本需要半天甚至更久的初步分析压缩到几分钟。
但它目前更适合做一名高效率的“分析搭子”,而不是替你拍板的业务负责人。
数字算对,只是第一关。口径透明,结论才真正可信。
下一期,我会继续测试 WorkBuddy 的其他能力,看看它面对更接近真实办公现场的任务,还能做到什么程度。
如果你也经常被复杂 Excel 折磨,欢迎把这篇文章转给那个总在加班做表格的人。
数据来源:UCI Machine Learning Repository,Online Retail II,DOI:10.24432/C5CG6D,CC BY 4.0。
夜雨聆风