
摘要:我把微信小微、豆包、元宝、Kimi、ChatGPT 拉到同一张桌子上,让它们干 5 件真人每天都在干的事——写周报、做PPT、查行程、辅导小学应用题、给孩子出手抄报。结果有点出人意料:跑分最猛的那个,差点把我儿子的数学带偏。
阅读时长:约 8 分钟|适合:打工人 + 家长
(本文含 AI 辅助生成内容,产品信息以官方最新版本为准,实测时间 2026 年 7 月。)
一、为什么我要做这场"最接地气"的横评
过去一个月,我们后台被问得最多的两类问题是:
- 打工人:小微、豆包、元宝、Kimi、ChatGPT,到底装哪个?
- 家长:能不能让 AI 辅导孩子作业?会不会把孩子教错?
市面上的横评大多在比"参数量""跑分""上下文长度"——但那是给程序员看的。普通人只想知道一件事:
我交代它一件真事,它能不能给我办妥,会不会翻车。
于是我设计了 5 个真实任务,把 5 款国民级 AI 助手都跑了一遍。这 5 个任务分成两组:
- •👔 打工人三件套:写周报、做PPT、查出差行程;
- •👨👩👧 家长两件套:辅导一道小学应用题、生成一份暑假手抄报。
不跑分、不看参数,只看结果。
二、5 个任务 × 5 款 AI,先上结论表
评分规则:每项任务按"能否完成 / 有没有硬伤 / 好不好用"打 ⭐️ 1–5 星。表后有详细拆解。
| 综合 | 17⭐️ | 19⭐️ | 18⭐️ | 17⭐️ | 20⭐️ |
一句话结论先放这儿:
没有全能冠军,但有明确分工——查东西找小微,写东西找豆包/ChatGPT,辅导作业只认 ChatGPT 和 Kimi。
下面是 5 个任务的现场实况。

三、任务① 写周报:有人写得像领导,有人写得像废话
我的输入(故意给得很碎,模拟真实打工人):
这周干了三件事:跟客户A对了方案,改了两版合同;参加了部门季度复盘,做了10页PPT;带新人小王熟悉了报销流程。下周要去上海出差两天。帮我写周报。
结果对比:
- •豆包 ⭐️⭐️⭐️⭐️⭐️
:唯一主动分了"本周完成/数据成果/下周计划"三段,还补了一句"客户A方案进入第二轮确认"——虽是脑补,但提醒我把模糊工作量化,语气职业。 - •Kimi ⭐️⭐️⭐️⭐️
:把周报文档直接丢给它,能基于真实材料写、最不"编";只给口语输入时发挥一般。 - •ChatGPT / 小微 ⭐️⭐️⭐️⭐️
:ChatGPT 结构清晰略正式;小微胜在微信生态、写完能直接转领导。 - •元宝 ⭐️⭐️⭐️
:中规中矩,有"综上所述"老干部腔,需再改。
💡 Tips:写周报把聊天记录/文档甩给它,让它基于真实材料写,能少踩 80% 的"编造进展"坑。
四、任务② 做PPT:谁是真·一键生成
我让它们围绕"Q3 部门工作规划"生成 8 页 PPT:ChatGPT 完成度最高(可直导 PPTX、母版干净);豆包中文模板最不"土";Kimi 速度最快;小微能微信内闭环但模板少;元宝审美偏传统。
⚠️ 避坑:AI 生成的 PPT 第一件事不是改字,而是检查数据图表——它很擅长"画一个看起来合理但数字是编的"柱状图,所有数字务必自己核对。
五、任务③ 查行程:微信里的事,微信自己最懂
这是 小微的主场,也是它唯一一个拿满分的项目。
我问:"明天下午去上海出差,帮我看看从公司到机场怎么走、航班几点、到了上海天气怎么样。"
- •小微 ⭐️⭐️⭐️⭐️⭐️
:直接调起微信里的行程/地图/天气服务,给了门到门方案,还提醒"明天上海有雷阵雨,带伞"。闭环体验碾压。 - •
其他四款都需要跳浏览器或 App,信息需要自己二次核对。
结论很清楚:凡是发生在微信里的事(查行程、订日程、转账问账、分析朋友圈),小微有"主场优势";凡是需要深度思考和创作的事,去别家。
六、任务④ 辅导应用题:这是全场最惊险的一轮
我出了一道小学四年级经典应用题(有陷阱):
一个水池,单开进水管 6 小时注满,单开出水管 8 小时放完。两管同时开,几小时注满?
正确答案:24 小时。(1/6 − 1/8 = 1/24)
结果如下:
| ChatGPT | |||
| Kimi | |||
| 元宝 | |||
| 豆包 | |||
| 小微 |
这是我认为本场横评最重要的一个发现:
🚨 不是所有 AI 都能辅导孩子作业。 涉及数学推理时,部分国产模型会出现"看起来很有道理但答案错了"的情况,而且语气十分自信——这对孩子尤其危险,因为孩子没有辨别能力。
给家长的 3 条建议:
- 1
数学/物理等理科辅导,优先用推理能力最强的模型(本场 ChatGPT、Kimi、元宝表现更稳); - 2
让 AI 必须写出解题步骤,不要只给答案,方便孩子和家长核对; - 3
低年级孩子用 AI 学习时,家长一定要在旁边看第一轮,确认它不会"自信地教错"。
七、任务⑤ 手抄报:审美这事儿,见仁见智
我让它们以"我的暑假生活"为主题出一份手抄报(含标题、3 个栏目、插图建议)。
- •元宝 ⭐️⭐️⭐️⭐️⭐️
:版式最像学校会贴出来的那种,栏目分明,还贴心给了涂色建议,家长最省心; - •豆包 ⭐️⭐️⭐️⭐️
:内容活泼,配了顺口溜,孩子会喜欢; - •小微/ChatGPT ⭐️⭐️⭐️
:能出内容但版式感弱; - •Kimi ⭐️⭐️
:文字质量高但不懂"手抄报"这种体裁,给了一堆纯文字。
这一轮也提示我们:再强的模型也有"不擅长的体裁",选 AI 像选工具,螺丝刀不能用来钉钉子。
八、最终建议:不同人该怎么选
把这张表存下来,或者转给那个总问你"装哪个 AI"的朋友。
| 小微 | |||
| 豆包 | |||
| Kimi | |||
| ChatGPT | |||
| 要辅导孩子理科作业 | ChatGPT | ||
| 元宝 |
九、写在最后
跑完这 5 个任务,我最大的感受是:
2026 年了,AI 助手已经没有"谁碾压谁",只有"谁在什么事上更靠谱"。 与其纠结装哪个,不如像我这样——让它们各干一件真事,答案比任何跑分都清楚。
而对家长来说,多留一个心眼:AI 越强,越要知道它在哪里会翻车。能放心用的地方放心用,该自己盯的地方别撒手。
📣 互动时间:你最常用哪个 AI 助手?有没有遇到过它"自信地翻车"的瞬间?评论区聊聊,点赞最高的三条,我下期拿来做二轮实测。
觉得有用,转发给那个总在群里问"用哪个AI"的朋友,或者收藏起来,下次换工具时翻出来对照。
夜雨聆风